La costituzione italiana del 1947 è stata scritta da CHATGPT!

Questa storia inizia come tante altre per puro caso, con un semplice dovere di padre nel controllo dei compiti delle vacanze del figlio.

Mio figlio è particolarmente portato per le discipline scientifiche, ama la matematica e di conseguenza, come spesso accade alla sua età, odia le discipline umanistiche. Per questo motivo il compito più pesante per lui è realizzare i due temi che il professore di italiano ha dato come consegna per le vacanze estive. Volente, ma soprattutto nolente, lo costringo a completare l’arduo e faticoso lavoro di riempire un paio di fogli di testo.

Ora, conosco bene come scrive mio figlio, o almeno credo, e dopo aver letto le sue realizzazioni sono SICURO che si è fatto aiutare da un GPT per scrivere almeno alcune delle frasi presenti nei suoi due temi, ma per una sicurezza ulteriore ed oggettiva decido di inserire gli elaborati scritti da mio figlio su un “rilevatore di AI” che, come mi aspettavo, mi segnala diverse parti di testo come “generate da intelligenza artificiale”.

Tronfio con l’evidenza della prova in mano torno dal figlio: “ECCO VEDI! In giallo sono segnate le parti che ti sei fatto scrivere dalla AI!”.

“Ma Papà, ma quelle frasi le ho scritte IO, LO GIURO!” tuona il figlio, con sincerità e stupore nei suoi occhi, il che mi costringe a controllare meglio quello che avevo in mano e… effettivamente quelle frasi evidenziate erano forse le uniche che avrei detto le avesse scritte lui, erano ALTRE le frasi che pensavo fossero da incriminare.

Colto a quel punto dal desiderio di approfondimento torno mesto nelle mie stanze e cerco di capire quanto siano affidabili questi strumenti iniziando un viaggio verso l’ignoto e senza volerlo, scoperchio un vaso di Pandora. Perché scopro che i rilevatori di testo generato dall’intelligenza artificiale in realtà non funzionano!

Ma andiamo con ordine, la questione era “Ci si può fidare dei rilevatori di scrittura generata da intelligenza artificiale?” e nel mio peregrinare nei contenuti del world wide web mi imbatto in questo articolo di Ars Technica di un paio di anni fa: Why AI writing detectors don’t work

L’articolo parte da una prova tanto divertente quanto illuminante: “Se si inserisce il documento legale più importante degli Stati Uniti, la Costituzione degli Stati Uniti, in uno strumento progettato per rilevare il testo scritto da modelli di intelligenza artificiale come ChatGPT, si otterrà che il documento sia stato quasi certamente scritto da un’intelligenza artificiale”.

Ok, mi dico, sono passati due anni, sicuramente avranno risolto questo problema, o forse no? Ma che succede se provo con LA COSTITUZIONE ITALIANA?

Cerco, prendo, taglio i primi dodici fondamentali articoli della nostra costituzione e li do in pasto inizialmente a CopyLeaks (copyleaks.com) che si proclama: “Lo strumento di rilevamento AI più accurato con una precisione di oltre 99% – Affermazioni sul rilevamento dell’intelligenza artificiale supportate da dati indipendenti studi di terze parti”

Risultato?

Contenuto AI trovato: 100% Percentuale di testo che potrebbe essere generato dall’intelligenza artificiale.

Praticamente la costituzione italiana l’ha scritta ChatGPT e non lo sapevamo!

Ok, dai… magari Copyleaks si presenta bene ma è una ciofeca. Fammi provare con un altro, textguard.ai: “TextGuard è uno strumento web educativo innovativo progettato per aiutare gli utenti a verificare l’originalità del testo e aumentare l’unicità tramite la parafrasi, senza perdere il significato originale.”

89% Testo generato da AI, 11% Testo scritto da umano! Beh dai, i nostri padri costituenti almeno ci han messo un pochino del loro sistemando qualche frase della costituzione…

No ma non ci posso credere, aspetta che chiedo in giro quale può essere uno strumento affidabile, ce ne sarà pure uno che funzioni bene… ZeroGPT, vai su zerogpt.net che stai tranquillo mi dicono.

“ZeroGPT è il più avanzato e preciso rilevatore di contenuti IA […] Sia che tu sia uno scrittore professionale, uno studente, un insegnante, un libero professionista o un redattore, zerogpt è progettato per aiutarti a identificare rapidamente e con precisione la fonte del testo. Grazie a una serie di algoritmi complessi, lo strumento è in grado di rilevare se il testo è stato generato da strumenti di intelligenza artificiale, come ChatGPT o Google Bard, o dal cervello umano.”

È molto probabile che il tuo testo sia stato generato da GPT.

29.02% è stato scritto da un essere umano

70.98% è stato generato da un’intelligenza artificiale/GPT

Ok, ormai è chiaro…

Il Capo dello Stato, Enrico De Nicola, firma la Costituzione italiana a palazzo Giustiniani, il 27 dicembre 1947. Al suo fianco, da sinistra a destra, Alcide De Gasperi, presidente del Consiglio, Francesco Cosentino, funzionario, Giuseppe Grassi, guardasigilli, e Umberto Terracini, presidente della Costituente. Oggi sappiamo che in realtà si fecero aiutare da CHATGPT per scriverla.

La domanda a questo punto sorge spontanea: Perché questi strumenti commettono errori così evidenti e spesso restituiscono falsi positivi?

La risposta ovviamente la troviamo quando cerchiamo di capire come funzionano.

Premetto che gran parte di quello che segue l’ho tratto dall’articolo di Ars Technica sopra citato e se volete approfondire ulteriormente ne consiglio la lettura completa.

Diversi rilevatori di scrittura basati sull’intelligenza artificiale utilizzano metodi di rilevamento leggermente diversi, ma con una premessa simile: esiste un modello di intelligenza artificiale addestrato su un ampio corpus di testo (composto da milioni di esempi di scrittura) e una serie di regole ipotizzate che determinano se è più probabile che la scrittura sia generata da un essere umano o dall’intelligenza artificiale.

Spesso vengono utilizzate delle proprietà dei testi note come “perplexity” e “burstiness” per valutare il testo e classificarlo.

Nell’apprendimento automatico, la “perplexity” è una misura di quanto un testo si discosti da ciò che un modello di intelligenza artificiale ha appreso durante il suo addestramento. Quindi, l’idea alla base della misurazione della “perplexity” è che, quando scrivono un testo, i modelli di intelligenza artificiale come ChatGPT cercheranno naturalmente ciò che conoscono meglio, ovvero ciò che deriva dai loro dati di addestramento. Più l’output è vicino ai dati di addestramento, minore è il livello di perplexity. Gli esseri umani sono scrittori molto più caotici – o almeno questa è la teoria.

Supponiamo di dover indovinare la parola successiva nella frase “Vorrei una tazza di _____”. La maggior parte delle persone riempirebbe lo spazio vuoto con “latte”, “caffè” o “tè”. Un modello linguistico addestrato farebbe lo stesso, perché queste espressioni ricorrono frequentemente nella lingua scritta. La perplexity di uno qualsiasi di questi tre risultati sarebbe piuttosto bassa, perché la previsione è piuttosto certa.

Consideriamo ora un completamento meno comune: “Vorrei una tazza di ragni”. Sia gli esseri umani che un modello linguistico ben addestrato rimarrebbero piuttosto sorpresi (o “perplessi”) da questa frase, quindi la sua perplexity sarebbe elevata.

Il problema è che è del tutto possibile anche per gli scrittori umani creare contenuti con un basso livello di perplexity (se scrivono utilizzando principalmente frasi comuni come “Vorrei una tazza di caffè”, ad esempio), il che compromette profondamente l’affidabilità dei rilevatori di scrittura generata da intelligenza artificiale.

Un’altra proprietà del testo misurata è la “burstiness”, ovvero il fenomeno per cui determinate parole o frasi appaiono in rapida successione o “a raffica” all’interno di un testo. In sostanza, la burstiness valuta la variabilità nella lunghezza e nella struttura delle frasi all’interno di un testo.

Gli scrittori umani spesso mostrano uno stile di scrittura dinamico, che si traduce in testi con lunghezze e strutture delle frasi variabili. Ad esempio, potremmo scrivere una frase lunga e complessa seguita da una breve e semplice, oppure potremmo usare una serie di aggettivi in una frase e nessuno in quella successiva. Questa variabilità è un risultato naturale della creatività e della spontaneità umana.

Il testo generato dall’intelligenza artificiale, d’altra parte, tende a essere più coerente e uniforme, almeno finora. I modelli linguistici, generano frasi con lunghezze e strutture più regolari. Questa mancanza di variabilità può comportare un basso punteggio di burstiness, a indicare che il testo potrebbe essere generato dall’intelligenza artificiale.

Tuttavia, anche la burstiness non è una metrica infallibile per rilevare contenuti generati dall’intelligenza artificiale. Come per la perplessità, ci sono delle eccezioni. Uno scrittore umano può scrivere in uno stile altamente strutturato e coerente, con conseguente basso punteggio di burstiness. Al contrario, un modello di intelligenza artificiale potrebbe essere addestrato a emulare una variabilità più simile a quella umana nella lunghezza e nella struttura delle frasi, aumentando il suo punteggio di burstiness. Infatti, con il miglioramento dei modelli linguistici di intelligenza artificiale, la loro scrittura assomiglia sempre di più a quella umana.

In definitiva, non esiste una formula magica che possa sempre distinguere un testo scritto da un essere umano da quello composto da una macchina. I rilevatori di scrittura possono fare ipotesi attendibili, ma il margine di errore è troppo ampio per poter contare su di essi per un risultato accurato.

I testi generati tramite i moderni GPT non sono realmente distinguibili da normali testi scritti da “esseri umani” e molto probabilmente sarà così per sempre.

Uno studio del 2023 condotto da ricercatori dell’Università del Maryland ha dimostrato empiricamente che i rilevatori di testo generati dall’intelligenza artificiale non sono affidabili in scenari pratici e che hanno prestazioni solo marginalmente migliori di un classificatore casuale. Non solo restituiscono falsi positivi, ma i rilevatori e gli schemi di watermarking (che cercano di alterare la scelta delle parole in modo rivelatore) possono essere facilmente vanificati da “attacchi di parafrasi” che modificano l’output del modello linguistico mantenendone il significato.

Questi strumenti in realtà proliferano perché tutti vogliono disperatamente che funzionino, soprattutto chi lavora nel settore dell’istruzione, ed è facile vendere un prodotto che tutti vogliono, soprattutto quando è davvero difficile dimostrare se sia efficace o meno.

Tra le notizie di professori troppo zelanti che bocciano un’intera classe a causa del sospetto di utilizzo di strumenti di scrittura basati sull’intelligenza artificiale e di studenti falsamente accusati di usare ChatGPT, l’intelligenza artificiale generativa sta mettendo in subbuglio l’istruzione. Alcuni pensano che rappresenti una crisi esistenziale, ricorda l’introduzione delle calcolatrici tascabili nelle aule, pur essendo passati decenni ancora oggi ci sono diversità di pensiero nel permetterne o meno l’utilizzo nell’ambiente scolastico.

Quello che è certo è che l’assistenza alla scrittura tramite intelligenza artificiale è destinata a durare e, se utilizzata con saggezza, i modelli linguistici basati sull’intelligenza artificiale possono potenzialmente accelerare la composizione in modo responsabile ed etico. Gli insegnanti potrebbero voler incoraggiare un uso responsabile e porsi domande come: il testo riflette le intenzioni e le conoscenze dell’autore? E l’autore umano può garantire per ogni fatto incluso? Un insegnante che sia anche esperto in materia potrebbe interrogare gli studenti sui contenuti del loro elaborato per verificare il loro livello di comprensione. Scrivere non è solo una dimostrazione di conoscenza, ma una proiezione della reputazione di una persona, e se l’autore umano non è in grado di sostenere ogni fatto rappresentato nello scritto, l’assistenza dell’IA non è stata utilizzata in modo appropriato.

Alla luce dell’elevato tasso di falsi positivi e del rischio di punire ingiustamente è chiaro che la scienza che rileva il testo generato dall’intelligenza artificiale è tutt’altro che infallibile, e probabilmente non lo sarà mai. Gli esseri umani possono scrivere come le macchine, e le macchine possono scrivere come gli esseri umani.

Una domanda più utile potrebbe essere: gli esseri umani che scrivono con l’assistenza delle macchine capiscono ciò che stanno dicendo? Se qualcuno utilizza strumenti di intelligenza artificiale per integrare contenuti fattuali in un modo che non comprende, questo dovrebbe essere abbastanza facile da capire per un lettore o un insegnante competente.

Come qualsiasi strumento, i modelli linguistici possono essere usati male o con competenza. E questa competenza dipende anche dal contesto: si può dipingere un’intera parete con un pennello o creare la Gioconda. Entrambi gli scenari rappresentano un uso appropriato dello strumento, ma ognuno richiede livelli diversi di attenzione e creatività umana.

Necessito feedback!

Questo sito utilizza Akismet per ridurre lo spam. Scopri come vengono elaborati i dati derivati dai commenti.