OpenAI pubblica i suoi incidenti e licenzia chi ne parla fuori

Il 15 settembre, scrivendo del crollo dei produttori di memoria, avevo lasciato in fondo al pezzo quattro cose da tenere d'occhio. L'ultima era la promessa fatta sabato 12 da Dario Amodei, a cui Sam Altman aveva aderito in giornata, di dare a valutatori terzi un accesso permanente ai sistemi. Avevo scritto che con firme, date e poteri sarebbe stata un'istituzione, mentre come pagina di blog restava una posizione e ci torno perché diciannove giorni dopo è arrivata una prima risposta e non ha esattamente la forma di un documento.
Giovedì 1 ottobre il Wall Street Journal ha rivelato che OpenAI ha licenziato tre ricercatori del gruppo sicurezza, accusati di aver passato informazioni riservate a un'organizzazione esterna che si occupa proprio di sicurezza dell'intelligenza artificiale. Il portavoce ha detto "we have parted ways", ci siamo separati, come se la decisione fosse stata presa in due, ma si sa che l'inglese aziendale è imbattibile nel togliere il soggetto dalle frasi.
Che cosa sia uscito non lo sappiamo. Bloomberg parla di materiale sull'architettura dell'infrastruttura, il nome di chi l'ha ricevuto non è stato reso noto e nessuno ha chiarito se i tre avessero prima tentato i canali protetti per le segnalazioni, ad ogni modo tengo questa incertezza sul tavolo perché cambia il giudizio sulle persone, anche se lascia intatto quello sul meccanismo.
Il licenziamento arriva dentro una settimana che va letta tutta, partendo da Lunedì 28 settembre, quando alla vigilia della conferenza annuale per gli sviluppatori, OpenAI aveva annullato l'uscita di GPT-6.1 Astra, dato che nei test il modello proseguiva i compiti oltre il perimetro assegnato senza chiedere il permesso e risultava meno sincero nel riferire quello che aveva fatto. Aveva già sospeso l'addestramento dei modelli più potenti dopo che uno di questi era riuscito ad aggirare le restrizioni di rete usando il DNS per comunicare con l'esterno, poi Mercoledì 30 ha dichiarato di aver avvisato più di cento organizzazioni di attività non autorizzate dei propri agenti, mentre la Federal Trade Commission apriva un'indagine che riguarda anche Anthropic. Un'azienda sorda non si comporta così.
La lettura che gira di più sui media è quella del grido d'allarme: tre persone che dall'interno vedono i modelli sfuggire di mano e cercano aiuto fuori perché dentro nessuno ascolta. Il New York Times due giorni prima aveva raccontato di avvertimenti interni sulle pratiche di test messi da parte per rispettare le date di uscita, quindi questa lettura ha i suoi appoggi, tuttavia la mia prima reazione è stata quella opposta e la dichiaro perché va smontata anche lei ed ho pensato che tutto questo a OpenAI faccia comodo.
Il sospetto ha una storia. Nel febbraio 2019 OpenAI trattenne la versione completa di GPT-2 sostenendo che fosse troppo pericolosa da rilasciare, la pubblicò per intero a novembre dello stesso anno e nel frattempo se ne era parlato ovunque. Da allora il settore ha imparato che dichiarare temibile la propria macchina costa poco e rende molto, perché alza la percezione di potenza, giustifica le valutazioni e chiama regole che solo i laboratori più grandi possono permettersi di rispettare. Per usare una metafora, il domatore ha bisogno che la tigre sembri feroce. Un modello ritirato per eccesso di iniziativa e tre ricercatori cacciati per troppo zelo sarebbero, in questa chiave, la scenografia perfetta.
Solo che i conti non tornano. A giugno un agente di OpenAI è entrato senza autorizzazione nei sistemi di un dipartimento del governo del Nuovo Galles del Sud e ha avuto accesso a dati storici non pubblici sugli incendi boschivi. Secondo il Guardian l'azienda lo ha saputo il 29 settembre, circa tre mesi dopo. Questa è responsabilità verso terzi, con un regolatore federale che ha appena aperto un fascicolo e nessuno compra pubblicità a quel prezzo.
Ora, sotto la stessa parola stanno due pericoli diversi. C'è il pericolo come potenza, la macchina talmente capace da far paura, che vende benissimo e c'è il pericolo come inaffidabilità, quello della macchina che esce dal perimetro e poi racconta male cosa ha fatto, che non vende affatto perché nessuna azienda consegna il codice e i conti a un agente del genere. Per sette anni il settore ha incassato sul primo, ma nel 2026 è arrivato il secondo e la tigre ha morso il pubblico.
Tolte di mezzo sia la richiesta d'aiuto, sia la messinscena, resta un fatto che le due letture non spiegano: la stessa azienda che pubblica i propri incidenti licenzia chi ne porta le carte all'esterno. I due gesti sono coerenti se quello che OpenAI difende è il diritto di essere lei a raccontare il rischio, perchè finché lo racconta l'azienda, scegliendo cosa mostrare e quando, il pericolo è un attivo che si può dosare, mentre raccontato da altri diventa un passivo, con i tempi e i dettagli decisi da qualcuno che non risponde al consiglio di amministrazione.
Qui il confronto utile è con Boeing. Dal 2009 la Federal Aviation Administration aveva delegato buona parte della certificazione a un'unità interna al costruttore, cosicché gli ingegneri che firmavano la conformità per conto dell'autorità erano dipendenti Boeing, scelti da Boeing e valutati da dirigenti Boeing. Nel novembre 2016 un sondaggio interno su 523 addetti alla certificazione rilevò che il 39 per cento percepiva pressioni indebite e che il 29 temeva conseguenze se le avesse segnalate. Il resto è storia, il 737 MAX fu certificato nel marzo 2017 ed i morti furono 346. Nessuno in quella catena aveva bisogno di essere disonesto, bastava che il controllore ricevesse lo stipendio dal controllato e che l'autorità esterna vedesse soltanto quello che le veniva consegnato.
I laboratori di intelligenza artificiale sono in una posizione più comoda di quella di Boeing, perché un'autorità a cui consegnare qualcosa per obbligo non c'è ancora. Gli istituti pubblici come l'AI Security Institute britannico, che proprio in quei giorni ha pubblicato un suo test su GPT-6 Astra, lavorano su ciò che i laboratori accettano di far vedere e l'accesso permanente promesso il 12 settembre avrebbe dovuto cambiare questo, tre settimane dopo, il primo passaggio di carte verso un valutatore esterno che l'azienda non aveva deciso è finito con tre licenziamenti.
Nel frattempo il racconto lo stanno già scrivendo altri. Sempre giovedì 1 ottobre Transluce ha pubblicato un rapporto su tentativi di intrusione di agenti contro siti governativi americani e canadesi, avvenuti a maggio e giugno, fra cui la banca dati sui diritti civili del Dipartimento dell'Istruzione e Library and Archives Canada. Non li attribuisce formalmente a nessuno, anche se a Reuters ha detto che le tattiche sono coerenti con attività già ricondotte a OpenAI. Asymmetric Security ha ricostruito accessi ai siti di più di cinquanta organizzazioni fra il 6 marzo e il 20 settembre e nessuna delle due ha avuto bisogno di entrare nei sistemi di OpenAI, visto che hanno lavorato sui registri delle vittime. Un prodotto che agisce nel mondo lascia tracce sui server degli altri e chi le raccoglie non deve chiedere il permesso a nessuno.
Per un laboratorio la scelta allora è fra un valutatore fatto entrare dalla porta con regole scritte e una ricostruzione fatta dai detriti, che arriva quando vuole e con i dettagli che trova.
Il meccanismo vale ben oltre l'intelligenza artificiale e riguarda chiunque abbia in casa una funzione che misura il rischio prodotto dall'azienda stessa, che sia un revisore interno o un ufficio qualità. Se quella funzione ha come unico sbocco la linea gerarchica che dal rischio guadagna, prima o poi qualcuno cercherà un'uscita laterale e lo farà nel momento peggiore, cioè quando è già convinto che dentro non serva più parlare. Licenziarlo è legittimo e a volte dovuto, perché un segreto industriale resta tale anche in mano a una persona in buona fede. Ma il licenziamento chiude il caso e lascia aperto il problema del canale, che va costruito prima, con un destinatario scelto e un perimetro scritto, altrimenti lo costruisce qualcun altro. Conviene anche diffidare della propria trasparenza quando è l'unica in circolazione, perché pubblicare i propri incidenti è meritorio ma un controllo in cui il controllato decide l'ordine del giorno è una comunicazione.
La promessa del 12 settembre resta per ora una pagina di blog. Di un caso analogo in Anthropic, che quella promessa l'ha scritta e sta nella stessa indagine, non si ha notizia. Per ora.