Testi scritti dall’Ai, perché i nuovi controlli si possono aggirare

Anche OpenAI comincia a firmare i testi della propria intelligenza artificiale per renderli distinguibili da quelli scritti da umani.

Anche OpenAI comincia a firmare i testi della propria intelligenza artificiale per renderli distinguibili da quelli scritti da umani. Dopo Anthropic, che ha annunciato il watermark per Claude ad agosto, OpenAI ha comunicato il 5 ottobre che nelle prossime settimane introdurrà una marcatura invisibile nei testi prodotti da ChatGPT e Codex nell’Unione europea. Ma gli stessi risultati pubblicati dalla stessa azienda mostrano quanto sia fragile questa tracciabilità: cambiare una parte delle parole può bastare a far sfuggire al controllo gran parte dei contenuti esaminati.

Per imprese, scuole e editori la promessa è interessante: avere un’indicazione sull’origine di un documento, senza affidarsi soltanto alle dichiarazioni di chi lo consegna. Il rischio però è attribuire a quell’indicazione un valore che non possiede. Un testo può essere stato prodotto interamente da una macchina e superare il controllo; un altro può nascere dal lavoro di una persona e conservare la traccia di una successiva rielaborazione automatica.

La spinta arriva dall’AI Act. Le disposizioni europee sulla trasparenza, applicabili dal 2 agosto, richiedono ai fornitori di rendere riconoscibili mediante strumenti automatici i contenuti sintetici, con alcune eccezioni, fra cui determinate funzioni di semplice assistenza alla revisione. Per i sistemi già sul mercato prima di quella data, la scadenza transitoria per la marcatura è il 2 dicembre 2026. L’obbligo crea un incentivo comune a sviluppare questi strumenti, ma non ne elimina le debolezze tecniche.

Il watermark testuale non è un’etichetta nascosta nel documento. Non consiste in caratteri invisibili da cancellare, né in informazioni che scompaiono copiando un brano in un altro programma. Come illustra lo studio su SynthID-Text pubblicato su Nature nel 2024, la marcatura interviene nella generazione: fra le diverse continuazioni plausibili di una frase, il sistema sceglie secondo un meccanismo che lascia una regolarità statistica riconoscibile.

Il lettore vede una normale sequenza di parole. Il rilevatore cerca invece quella regolarità nell’insieme del brano. È una distinzione decisiva: cambiare carattere tipografico o incollare il testo senza formattazione non altera le parole e quindi non rimuove, di per sé, la firma.

Anthropic utilizza una variante di SynthID-Text e ha scelto un’applicazione mondiale, spiegando di non disporre ancora di un modo stabile per circoscriverla geograficamente. La firma non identifica l’utente. Inoltre, il controllo cerca il segnale di Claude: non è un certificatore universale capace di riconoscere qualunque intelligenza artificiale.

Qui arrivano i problemi. Il primo modo per aggirare i controlli è intervenire proprio sulle parole. Nelle valutazioni pubblicate da OpenAI, su risposte in inglese tratte da quesiti del dataset Eli5, il rilevamento di brani di 400 token — le unità testuali elaborate dal modello — scende da circa il 92% al 66% sostituendo il 10% delle parole con sinonimi. Con il 25% di sostituzioni precipita al 17%.

Un secondo modo è la parafrasi: conservare il contenuto e cambiare formulazione, struttura delle frasi e ordine dell’esposizione. L’operazione può essere svolta da un’altra IA. Il testo rimane così di origine automatica, mentre la traccia della prima generazione si indebolisce.

Il problema è documentato nello studio di Vinu Sankar Sadasivan e colleghi, Can AI-Generated Text be Reliably Detected?, pubblicato su Transactions on Machine Learning Research e aggiornato nel 2025. Gli autori hanno sperimentato parafrasi successive su brani di circa 300 token, riscontrando cali nel riconoscimento di diversi sistemi, anche basati su watermark, spesso con un deterioramento contenuto della qualità.

Tradurre aggiunge un’altra trasformazione: cambiano parole e costruzioni. Il servizio che riscrive o traduce potrebbe però imprimere una nuova firma AI. Anthropic precisa, per esempio, che una traduzione prodotta da Claude viene marcata. Si può dunque perdere la traccia del primo modello e acquisire quella del secondo.

A complicare il quadro è la confusione tra watermark e rilevatori commerciali. Questi ultimi possono cercare caratteristiche ricorrenti nella scrittura automatica senza avere accesso alla chiave della marcatura. Valutano quanto un testo assomigli a quelli prodotti dai modelli: il loro verdetto dipende quindi anche dalla lingua, dal genere di documento e dallo stile dell’autore.

Lo studio di Weixin Liang e colleghi pubblicato su Patterns nel 2023 ha mostrato entrambi i lati del problema. I detector esaminati tendevano a classificare erroneamente come artificiali elaborati in inglese di persone non madrelingua. Al tempo stesso, una rielaborazione stilistica dei contenuti generati da Chatgpt ne riduceva il riconoscimento.

Esistono però strumenti più recenti, come Pangram, che cercano di riconoscere la scrittura artificiale anche senza watermark, attraverso modelli addestrati a distinguere testi umani, automatici e misti. Nei test dichiarati dall’azienda, Pangram 4 identifica l’intervento dell’IA nel 98,83% dei testi rielaborati da 13 servizi che promettono di renderli “umani”. Pangram indica anche in modo dettagliato quali frasi sono umane e quali AI, in un testo.

L’azienda dichiara comunque che si è tarata per favorire più i falsi negativi che i falsi positivi. Ossia piuttosto che indicare come artificiale un contenuto umano, consapevole dello stigma che questa sentenza può comportare, preferisce sbagliare in senso opposto.

La questione è complicata dal fatto che la linea di demarcazione tra scrittura AI e scrittura umana è sottile. Ci sono testi scritti da un’AI e poi revisionati da un’altra. Altri in cui a scrivere è un umano influenzato però nello stile da quello dell’AI (come già si riscontra in molti casi).

Resta infine il problema di valutare questi sistemi dall’esterno. OpenAI riserva inizialmente il proprio detector a ricercatori approvati e organizzazioni specializzate.

Nel preprint del settembre 2026 Watermarks Without Verification, Alexander Nemecek e colleghi hanno studiato un’implementazione aperta di SynthID-Text su due modelli a pesi disponibili, proprio perché non potevano verificare direttamente i sistemi commerciali. Gli autori chiedono protocolli condivisi e audit indipendenti: senza accesso sufficiente è difficile controllare tanto le promesse dei produttori quanto le accuse di inefficacia.

Per chi riceve una relazione, un elaborato o un contenuto editoriale, la conseguenza può essere trattare questa marchiatura come prova di un inganno. Ma sarebbe una conclusione affrettata, come si è visto.

La cronologia delle revisioni, le fonti utilizzate e la capacità di motivare le conclusioni aiutano di più a ricostruire il lavoro (umano) svolto. Un indicatore automatico, da solo, non basta a contestare una condotta “artificiale”. Né a dare prova di autenticità umana.

Insomma, gli strumenti di marcatura dovrebbero aumentare la trasparenza in questo grande caos che è la scrittura AI, ma a loro volta introducono nuova confusione. Dovremo imparare a farci i conti.

Articoli correlati