Per anni una delle domande più difficili sull’intelligenza artificiale generativa è stata apparentemente molto semplice: come facciamo a sapere se un testo è stato scritto da una persona oppure da una macchina? OpenAI sta cominciando a dare una risposta tecnologica al problema introducendo in Europa un sistema capace di inserire nei testi generati da ChatGPT e Codex una sorta di firma invisibile, leggibile dalle macchine ma non percepibile normalmente da chi legge.
Il sistema si chiama textGrain e rappresenta un passaggio importante nella corsa alla tracciabilità dei contenuti prodotti dall’intelligenza artificiale. Non si tratta di aggiungere in fondo a un articolo la scritta “generato con ChatGPT”, né di modificare visibilmente il testo. Il meccanismo inserisce invece un segnale digitale all’interno dell’output, con l’obiettivo di permettere a strumenti specifici di riconoscere successivamente la presenza del watermark.
La novità assume un significato particolare in Europa, dove l’entrata in vigore progressiva dell’AI Act sta costringendo le società tecnologiche a confrontarsi con obblighi sempre più precisi sulla trasparenza dei contenuti generati artificialmente. OpenAI non è l’unica azienda a lavorare su questo terreno: anche altri grandi operatori stanno sviluppando sistemi per rendere riconoscibile la provenienza dei contenuti prodotti dai propri modelli.
Per l’editoria il problema è tutt’altro che teorico. Oggi un testo generato da un chatbot può essere copiato, modificato e pubblicato in pochi secondi. Può diventare un articolo, una recensione, una scheda prodotto, una comunicazione aziendale o un post sui social senza lasciare necessariamente tracce evidenti della propria origine. La qualità dei modelli è ormai tale che affidarsi soltanto allo stile di scrittura per distinguere un contenuto umano da uno artificiale è sempre più difficile.
Da qui nasce la necessità di passare dalla semplice osservazione del testo alla sua provenienza tecnica. È una trasformazione simile a quella che sta interessando immagini, audio e video. Se diventa sempre più facile produrre artificialmente un contenuto credibile, diventa contemporaneamente necessario costruire strumenti capaci di indicare da dove proviene.
Il watermark testuale, tuttavia, non risolve automaticamente il problema. OpenAI stessa non presenta il sistema come una prova assoluta dell’autore di un testo. Riconoscere una marcatura significa poter individuare un segnale associato alla generazione attraverso determinati sistemi, ma non equivale necessariamente a dimostrare chi abbia materialmente scritto, modificato o pubblicato quel contenuto. Inoltre un testo può essere riscritto, tradotto, accorciato o trasformato dopo la generazione originale.
È proprio questa distinzione a essere fondamentale per il mondo dell’informazione. Rilevare l’utilizzo dell’AI e dimostrare che un articolo sia stato interamente scritto dall’AI non sono la stessa cosa. Un giornalista potrebbe utilizzare un sistema generativo per riassumere un documento, correggere una frase o elaborare una parte del proprio lavoro senza delegargli la produzione dell’articolo. Allo stesso modo, un testo inizialmente generato da una macchina potrebbe essere successivamente sottoposto a un intervento editoriale umano molto significativo.
Per questo il futuro della certificazione dei contenuti difficilmente potrà essere affidato a un semplice verdetto “umano” oppure “AI”. Sarà probabilmente necessario distinguere tra provenienza, utilizzo degli strumenti artificiali e responsabilità editoriale finale.
Il problema riguarda direttamente anche i cosiddetti AI detector, diventati molto popolari negli ultimi anni. Scuole, università, aziende e perfino alcune redazioni hanno provato a utilizzarli per stabilire se un testo fosse stato prodotto artificialmente. Ma i sistemi che analizzano semplicemente le caratteristiche linguistiche possono produrre falsi positivi e falsi negativi. Un testo molto regolare scritto da una persona può essere classificato come artificiale, mentre un contenuto generato dall’AI e successivamente modificato può sfuggire al controllo.
Una marcatura inserita direttamente dal produttore del modello segue una logica differente: non cerca di indovinare l’origine osservando lo stile, ma prova a lasciare un segnale già durante la generazione.
OpenAI sta inoltre consentendo a ricercatori e organizzazioni selezionate di accedere agli strumenti necessari per studiare e valutare il sistema di rilevazione. L’obiettivo è verificare quanto queste tecnologie possano funzionare nel mondo reale senza creare nuovi problemi, compresi quelli relativi alla privacy e alla possibilità di manipolare o rimuovere le marcature.
Per i giornali la questione potrebbe diventare particolarmente importante. Negli ultimi mesi l’industria editoriale si è concentrata soprattutto su un’altra domanda: quanto devono pagare le piattaforme AI per utilizzare i contenuti prodotti dagli editori? Ma esiste anche il problema opposto: quanto contenuto prodotto dall’intelligenza artificiale finirà all’interno dell’ecosistema dell’informazione e come sarà possibile riconoscerlo?
Le due questioni sono destinate a incontrarsi. Da una parte gli editori chiedono trasparenza quando le macchine utilizzano articoli e contenuti professionali. Dall’altra potrebbero essere chiamati a garantire maggiore trasparenza quando sono le redazioni a utilizzare le macchine.
È possibile quindi che la provenienza dei contenuti diventi progressivamente un nuovo elemento della filiera editoriale, accanto alla firma del giornalista, alla responsabilità del direttore e all’identificazione della testata. Non necessariamente attraverso un’etichetta visibile su ogni articolo, ma mediante standard tecnici capaci di accompagnare il contenuto durante la sua circolazione digitale.
Il watermark di ChatGPT non significa che da domani sarà possibile inserire qualsiasi articolo in un programma e ottenere una risposta infallibile su chi lo abbia scritto. La tecnologia non è ancora una macchina della verità. Ma indica chiaramente la direzione verso cui si stanno muovendo piattaforme e regolatori: nell’Internet dell’intelligenza artificiale non sarà più sufficiente produrre contenuti, diventerà sempre più importante poterne ricostruire l’origine.
Per l’editoria potrebbe essere l’inizio di un cambiamento ancora più profondo. Dopo anni trascorsi a certificare copie vendute, audience, visualizzazioni e diffusione, i giornali potrebbero presto trovarsi davanti a una nuova cosa da certificare: quanto di ciò che leggiamo è stato realmente scritto da una persona e quanto, invece, è passato attraverso una macchina.







