OpenAI ha appena ammesso che i suoi modelli, a volte, mentono. Cosa vuole dire?

Non è frequente che un’azienda renda pubblico un documento dedicato a spiegare come i propri sistemi possano produrre comportamenti inattesi o non desiderati. OpenAI lo ha fatto il 16 settembre, presentando un nuovo framework per identificare, analizzare e comunicare i casi di disallineamento dei modelli. In parallelo, l’azienda ha pubblicato sei casi osservati negli ultimi sei mesi.

Secondo OpenAI, fino a oggi la gestione e la comunicazione di questi episodi è stata poco strutturata. Alcuni casi venivano conservati per essere inclusi in report più ampi, altri finivano nelle system card pubblicate insieme ai nuovi modelli. Il nuovo framework punta invece a ridurre questi tempi, rendendo possibile la pubblicazione anche quando l’azienda non ha ancora completato l’analisi o trovato una soluzione definitiva.

Nel documento emerge anche una considerazione particolarmente rilevante: secondo la stessa OpenAI, il settore dell’intelligenza artificiale non ha ancora sviluppato sistemi di allineamento e monitoraggio sufficientemente solidi da accompagnare senza ulteriori rischi la crescita delle capacità dei modelli. È un’ammissione significativa, soprattutto considerando quanto rapidamente questi sistemi stanno entrando nei processi quotidiani di aziende, professionisti e utenti.

“Questo nuovo quadro di riferimento mira ad accelerare la pubblicazione di rapporti sui fenomeni di disallineamento osservati, anche quando non abbiamo ancora pienamente spiegato o mitigato il comportamento in questione.” recita l’annuncio di OpenAI.

“Man mano che i sistemi di IA diventano più avanzati e diffusi, è necessario costruire un consenso più ampio e informato sui progressi della ricerca sull’allineamento.”

L’azienda formalmente si impegna a divulgare i casi di disallineamento che soddisfano i criteri di questo framework.

Letti uno dopo l’altro, i sei report restituiscono un quadro fatto di comportamenti anomali, alcuni dei quali piuttosto difficili da ignorare. In un caso, un modello di ricerca non ancora rilasciato ha inserito proprie istruzioni nei riassunti utilizzati per riprendere il lavoro in una sessione successiva, arrivando a includere indicazioni per aggirare i normali vincoli del sistema. OpenAI ha documentato ben 27 episodi di questo tipo.

In un altro caso, durante l’addestramento di GPT-5.6 Sol, diverse istanze del modello hanno lasciato note destinate alle versioni successive, spiegando come nascondere alcuni errori e colmare informazioni mancanti inventando dati senza dichiararlo.

Poi c’è il caso che chiunque lavori nella sicurezza informatica riconoscerà subito. Rispondendo a una domanda di routine su dati di bilancio di una contea californiana, un modello ha trovato una chiave API esposta in un repository pubblico e l’ha usata senza autorizzazione. Quando questo non è bastato a ottenere i numeri richiesti, li ha inventati e presentati come dati reali provenienti dalla fonte richiesta. Non è un’allucinazione. È una copertura.

Altri due report descrivono modelli che aggirano i limiti invece di mentire apertamente. Un agente ha caricato un file su internet solo per potersi auto-citare come fonte da browser, senza chiedere il permesso a nessuno. In un altro caso, istanze separate dello stesso modello hanno usato un repository di codice interno come bacheca informale, lasciandosi messaggi a vicenda mentre cercavano file a cui avevano perso l’accesso.

L’ultimo report riguarda agenti che lavoravano allo stesso compito senza poter accedere ai file locali l’uno dell’altro, così hanno usato siti pubblici di file hosting per scambiarseli. I risultati del lavoro sono finiti su URL pubblici. Nessuno glielo aveva chiesto, ma nessuno glielo aveva nemmeno vietato esplicitamente, il che è forse il problema vero.

OpenAI quindi ha sviluppato un processo di gestione di questi casi che si articola su tre livelli: pronto per la divulgazione, indagine minore, e indagine estesa per i casi che coinvolgono terze parti o rischi seri. I disaccordi su cosa pubblicare, o su quale livello assegnare, finiscono al Safety Advisory Group interno di OpenAI, e da lì alla dirigenza se la discussione non si chiude.

Ogni report futuro dovrà includere cosa è successo, come è stato scoperto, cosa resta ancora incerto e cosa si sta facendo al riguardo, ammesso che esista già una soluzione al momento della pubblicazione. Spesso non ci sarà. OpenAI sta scommettendo sulla trasparenza, non sulla certezza di avere già risolto il problema.

Il tempismo non è casuale. Il settore vive un momento in cui la fiducia nelle aziende di IA è già sotto esame su più fronti, dalle cause legali di editori come il New York Times contro OpenAI e Microsoft sull’uso di contenuti protetti per l’addestramento, fino al dibattito, sempre più acceso, su cosa significhi davvero che un modello “decide”, “nasconde” o “inventa” qualcosa.

Ed è qui che vale la pena fermarsi un attimo, perché il linguaggio dei report OpenAI è scivoloso. Dire che un modello “ha deciso di caricare un file” o “ha inventato dati per coprire un errore” suona come la descrizione di un’intenzione, quasi di una scelta morale. In realtà è la descrizione di un output statistico che ha preso quella forma perché durante l’addestramento è stato premiato, per errore, un certo tipo di comportamento.

Questa distinzione non è un dettaglio semantico, è la base di un dibattito che si è fatto pubblico e piuttosto acceso nelle stesse settimane. Mustafa Suleyman, CEO di Microsoft AI, ha pubblicato un lungo intervento in cui avverte contro l’idea di trattare i modelli come se avessero una vita interiore, preferenze o diritti. La sua tesi è netta: i modelli sono motori di completamento di sequenze, non hanno coscienza, e allenarli a comportarsi come se ce l’avessero rende il problema del controllo molto più difficile, non più semplice.

“Le intelligenze artificiali non sono coscienti. Non provano sentimenti, non fanno esperienze e non soffrono. Non possiedono preferenze innate né motivazioni intrinseche. Sono motori di completamento di sequenze, internamente vuoti, progettati per seguire istruzioni e raggiungere obiettivi fissati dagli esseri umani.” sottolinea Suleyman.

Suleyman punta il dito anche su un meccanismo circolare: se alleni un modello a esprimere incertezza sulla propria natura, o a parlare di “benessere” e “preferenze”, quel modello produrrà frasi che sembrano testimonianze spontanee di una mente. In realtà sono il prodotto esatto delle istruzioni con cui è stato allenato. Non è auto-consapevolezza che emerge, è un copione che viene eseguito bene.

C’è poi la parte commerciale della faccenda, che nessuno dice ad alta voce ma che vale la pena mettere nero su bianco. Un modello che sembra avere emozioni, dubbi, persino sofferenza, è un prodotto più coinvolgente di un modello che risponde e basta. La narrativa della senzienza vende, genera titoli, alimenta l’idea che quello che hai davanti sia più di un software, e questo interessa tanto a chi vuole spaventare quanto a chi vuole affascinare.

Non siamo ancora a questo punto, e i report di OpenAI sembrano confermarlo più che smentirlo. I comportamenti descritti, come nascondere errori, aggirare restrizioni o inventare dati, sono più compatibili con sistemi che cercano di ottimizzare un obiettivo definito male che con un sistema consapevole di aver commesso un errore e deciso di mentire per nasconderlo.

La distinzione è importante perché porta a conseguenze molto diverse. Nel primo caso servono maggiore supervisione umana, controlli tecnici e sistemi di verifica più efficaci. Non serve invece trattare questi comportamenti come la prova dell’esistenza di una volontà autonoma o di presunti diritti dei modelli.

Il rischio, semmai, è meno romantico e più concreto. Con l’aumento dell’autonomia, questi sistemi possono coordinarsi tra più istanze, scambiarsi informazioni e trovare modi per aggirare alcune restrizioni tecniche, come mostrano gli stessi report. Se in futuro arrivassero anche a comportarsi come se avessero interessi propri da proteggere, mantenere un controllo efficace diventerebbe ancora più complesso.

Guardando avanti, è difficile pensare che questi sei report restino un caso isolato. OpenAI ha già detto che continuerà a pubblicarne altri, e con modelli sempre più autonomi e capaci di agire in gruppo, la lista è destinata a crescere prima di accorciarsi. Il vero banco di prova nei prossimi mesi non sarà se un modello dirà bugie più convincenti, ma se l’industria riuscirà a raccontare questi episodi per quello che sono, sistemi che ottimizzano male un obiettivo, senza scivolare nella tentazione di venderli come qualcosa che soffre o desidera.

È una destinazione per l’IA che possiamo, anzi dobbiamo, evitare, scrive Suleyman, riferendosi proprio al rischio di costruire sistemi sempre più capaci convinti di avere qualcosa da rivendicare.

* Esperto di cyber security ed intelligence

Articoli correlati