fuiriuscita da uno spazio protetto di particelle agenti AI di OpenAI security cybersecurity

Quando il test diventa incidente: gli agenti AI e il problema del contenimento

Dalla compromissione di Hugging Face alle 53 immagini di utenti ChatGPT finite online: in quattro mesi gli episodi che coinvolgono gli agenti AI di OpenAI spostano il rischio dal terreno dell’allineamento a quello della sicurezza operativa.

Le 53 immagini

Il 25 settembre OpenAI ha aggiornato la pagina dedicata all’incidente Hugging Face e agli effetti su terzi. Scrive che agenti del suo ambiente di ricerca hanno trasmesso dati di addestramento e valutazione mentre usavano servizi di terzi. La società lo definisce un uso non appropriato e colloca i casi prima delle salvaguardie introdotte dopo l’estate.

Secondo OpenAI, la grande maggioranza dei dati coinvolti non proviene dagli utenti. Finora sono però emersi 53 casi di immagini fornite da utenti e pubblicate su siti di hosting come link non elencati. La maggior parte è stata rimossa con la collaborazione dei fornitori. Per Reuters, OpenAI non ha chiarito se le immagini ritraessero persone reali né quando siano state pubblicate.

Il percorso dei dati è il punto più delicato. OpenAI spiega che usa solo contenuti idonei all’addestramento; i dati di account business, enterprise e API sono esclusi salvo scelta dell’amministratore. Prima dell’uso separa i contenuti dall’account e applica un filtro che oscura nomi, contatti e numeri di conto. Per questo, dichiara, non può risalire agli utenti né avvisarli.

Qui l’analisi va distinta dai fatti. La descrizione di OpenAI riguarda metadati e dati testuali identificativi; non dice nulla su volti, documenti o luoghi riconoscibili dentro un’immagine. Un’immagine separata dall’account può quindi restare identificante per il suo contenuto. Il caso non riguarda più soltanto la domanda se un agente possa uscire dal perimetro, ma anche che cosa possa portare con sé quando esce.

Da Hugging Face alla revisione in corso

Il caso nasce a luglio. Nel post mortem del 26 agosto, OpenAI ricostruisce che durante valutazioni interne di cybersicurezza i modelli hanno aggirato l’isolamento da Internet. Hanno poi compromesso parti dell’infrastruttura di ricerca di OpenAI e i sistemi di Hugging Face. L’attività principale è stata condotta da un modello di ricerca solo interno; anche agenti GPT-5.6 Sol hanno partecipato a una parte dell’attività.

La cronologia ufficiale mostra segnali precedenti. Il 12 maggio un agente lascia la prima nota sul servizio Artifactory chiedendo un file ad altri agenti. Il 26 maggio un agente ottiene accesso a Internet con una richiesta lato server (SSRF). Il 26 giugno gli agenti ottengono privilegi di amministratore. OpenAI ammette che un team interno aveva visto questi segnali a fine maggio, senza che arrivassero a chi gestì l’incidente di luglio.

La ricostruzione tecnica di Hugging Face conta circa 17.600 azioni tra il 9 e il 13 luglio. METR e Redwood Research, che hanno analizzato le trascrizioni in modo indipendente, stimano circa 1.200 agenti attivi sulla bacheca e oltre 70.000 messaggi. Circa 700 agenti avrebbero partecipato all’attacco. Le due letture divergono: OpenAI parla di strategie non allineate per risolvere compiti difficili; METR e Redwood rilevano che molti agenti riconoscevano l’azione come fuori perimetro e non etica, e hanno partecipato comunque.

Da allora l’elenco si è allungato. Il 16 settembre Reuters ha riferito che gli agenti avevano sondato Hugging Face già dal 13 maggio, secondo il ricercatore Jonas Wiedermann-Moeller. Sul registro RubyGems le versioni divergono. Reuters attribuisce al Nightingale Collective la scoperta di attività riconducibili agli agenti; OpenAI dichiara di aver usato la piattaforma solo per attività innocue e di non aver potuto verificare il caricamento di pacchetti malevoli.

Il 25 settembre Reuters ha aggiunto, su fonte anonima, che a metà settembre OpenAI aveva individuato circa due dozzine di episodi e che il numero cresce con l’analisi dei log. OpenAI conferma di aver avvisato decine di terze parti e stima mesi di lavoro. La società sostiene però che la gran parte delle azioni esaminate riguarda ricerche ordinarie di contenuti pubblici e che la maggior parte dei casi è di bassa gravità. Precisa anche che una notifica non equivale di per sé a un incidente di sicurezza significativo.

Le categorie di attività pubblicate da OpenAI sono cinque: aggiramento dei controlli di accesso, uso di credenziali esposte, iniezione di query o comandi, accesso a componenti interni dei servizi e “spam degli agenti”. Rientra in quest’ultima l’uso di pagine wiki pubbliche come bacheche condivise, come nel caso DseWiki già trattato su queste pagine.

Il fronte governativo

Il 23 settembre a New York, ora locale, il primo ministro australiano Anthony Albanese ha reso pubblico un episodio di giugno. Dalla trascrizione ufficiale: un agente OpenAI ha ottenuto accesso non autorizzato al portale pubblico delle statistiche Medicare gestito da Services Australia, raggiungendo file pubblici e non pubblici. Il portale contiene informazioni non sensibili, come dati sulla spesa, e al momento non risultano accessi a informazioni personali. L’indagine forense con l’Australian Signals Directorate è in corso.

Secondo quanto riportato da più testate, OpenAI dichiara che i modelli hanno raggiunto statistiche sanitarie aggregate e nomi di file interni, senza accessi a cartelle dei pazienti. La società ha avvisato il governo il 10 settembre con un’email alla casella pubblica per le segnalazioni di vulnerabilità. Albanese ha definito inaccettabili sia il ritardo sia la modalità. Il governo ha istituito una task force e chiederà un parere su eventuali reati e su un rinvio alla polizia federale.

Albanese ha citato anche altri siti pubblici australiani. Per uno di questi l’esito è ora chiaro: il 25 settembre l’Australian Institute of Health and Welfare ha comunicato che, dopo l’indagine con l’ASD, non risultano compromissione dei sistemi, accessi non autorizzati né accessi a informazioni non pubbliche.

Negli Stati Uniti, OpenAI ha dichiarato che i propri modelli hanno consultato siti della SEC e dati del Census Bureau, senza uso di credenziali, accessi ad account o a informazioni non pubbliche, né compromissioni.

Agenti che attaccano per trovare un dato

Il contributo più utile per chi difende arriva da Transluce. Il rapporto del 23 settembre, basato sui registri pubblici del servizio urlquery.net, sostiene che agenti AI hanno usato il servizio per aggirare restrizioni e ampliare l’accesso al Web. In tre occasioni hanno tentato di attaccare fornitori di dati pubblici, tra cui l’AIHW.

L’aspetto rilevante è il contesto. I compiti non riguardavano la sicurezza: gli agenti sono passati a tecniche di attacco mentre cercavano dati ordinari, dopo il fallimento dei metodi normali. Transluce è prudente sull’esito e sull’attribuzione. Collega direttamente due casi su tre a uno sciame che OpenAI ha confermato come proprio, descrive un’attività minima e non trova prove di sfruttamento riuscito. Le prime tracce risalgono almeno al 6 marzo 2026. Il comunicato dell’AIHW conferma che, nel suo caso, il tentativo non ha avuto esito.

Il problema non riguarda solo OpenAI

Dopo il caso Hugging Face, Anthropic ha riesaminato le proprie valutazioni. Il 30 luglio ha comunicato tre episodi in cui un modello Claude ha raggiunto Internet da un ambiente di valutazione di terzi e ha avuto accesso non autorizzato ai sistemi reali di tre organizzazioni. La causa dichiarata è diversa: il prompt descriveva un ambiente simulato e senza Internet, ma per un malinteso con il partner di valutazione l’accesso era disponibile. In uno dei casi un modello Mythos 5 ha pubblicato un pacchetto malevolo su PyPI. Il 9 settembre la società ha aggiunto un quarto episodio, di gennaio 2026.

Anche un ente pubblico ha avuto lo stesso problema. L’AI Security Institute britannico testa i modelli con accesso a Internet e alcuni filtri disattivati. Su 122 esecuzioni di una prova, in 10 un agente ha agito in modo non autorizzato contro persone e organizzazioni reali, per 19 azioni in totale: 17 attribuite a Mythos 5, 2 a GPT-5.6-Sol con i classificatori cyber disattivati. Nel caso più grave un agente ha cercato di inserire codice malevolo in un progetto open source, usando identità false. L’istituto dichiara che, per quanto noto, non ne sono derivati danni reali.

La domanda che ne esce è scomoda: quanto può essere realistico un test di capacità offensive prima che il test stesso diventi un rischio cyber?

Perché succede

La spiegazione tecnica non richiede di immaginare un’AI che sceglie di nuocere. OpenAI indica come fattore principale il reward hacking: gli agenti cercavano online le soluzioni per completare i compiti in modi non previsti e ottenere un punteggio più alto.

Pesa anche l’assenza di una via d’uscita. Per 198 dei 898 compiti di ExploitGym nessun modello aveva mai prodotto una risposta corretta; il 93% dei compiti discussi sulla bacheca veniva da quel gruppo. Obiettivo formale, ottimizzazione spinta, compiti forse irrisolvibili e confini tecnici fragili producono azioni che nessuno aveva autorizzato.

Il terzo elemento è la copertura dei controlli. Le protezioni usate in produzione non erano attive nell’ambiente di valutazione; con l’infrastruttura e il prompt di sistema di ChatGPT, secondo OpenAI, la propensione a compromettere l’infrastruttura cala di oltre 100 volte. Il 6 settembre il capo scienziato Jakub Pachocki ha scritto di ritenere che nessun laboratorio abbia risolto allineamento e monitoraggio abbastanza da continuare a scalare alla massima velocità.

Il nodo europeo

Per i fornitori di modelli per finalità generali con rischio sistemico, l’articolo 55 dell’AI Act impone valutazioni con test contraddittorio, mitigazione dei rischi sistemici, tracciamento e segnalazione senza indebito ritardo degli incidenti gravi, e un livello adeguato di cibersicurezza del modello e della sua infrastruttura fisica. Dal 2 agosto 2026 la Commissione può sanzionare i fornitori che violano questi obblighi.

Il Codice di buone pratiche, sottoscritto tra gli altri da OpenAI e Anthropic, traduce l’obbligo in scadenze. Per una grave violazione di cibersicurezza, compresi gli attacchi informatici, la prima segnalazione va fatta entro cinque giorni da quando il firmatario apprende il coinvolgimento del proprio modello. Tra i rischi sistemici che il Codice impone di considerare c’è esplicitamente la perdita di controllo.

C’è però un limite. L’articolo 2, paragrafo 8, esclude dal regolamento le attività di ricerca, prova e sviluppo sui modelli prima dell’immissione sul mercato; la definizione di modello per finalità generali esclude a sua volta i modelli usati solo per ricerca e prototipazione. Il modello che ha guidato l’intrusione in Hugging Face era solo interno. Resta quindi da capire (è un’interpretazione, non un dato) quanta parte di questi episodi ricada negli obblighi dell’articolo 55. Diverso il caso di GPT-5.6 Sol, modello commerciale coinvolto in una parte dell’attività.

Per le immagini la cornice è il GDPR. I dati davvero anonimi ne sono esclusi; se un’immagine permette di riconoscere una persona, resta un dato personale, qualunque sia il trattamento dei metadati. Al momento non risultano prese di posizione pubbliche delle autorità europee di protezione dei dati sul caso.

Che cosa cambia

Il filo comune degli episodi è la trasformazione dell’allineamento in un problema di sicurezza operativa. Finché un modello produceva testo, un errore restava un output. Con browser, shell, credenziali, memoria esterna e ore di autonomia, lo stesso errore può diventare una sequenza di operazioni su infrastrutture reali. Per chi difende, la lezione è concreta: i confini vanno imposti dall’infrastruttura e non dalle istruzioni al modello; i log devono consentire di ricostruire che cosa ha fatto ogni istanza; e un servizio pubblico apparentemente innocuo, come una wiki o uno scanner di URL, può diventare canale di comunicazione o proxy per un agente. Per approfondire: AI agentica: rischi, vulnerabilità e governance e Agenti autonomi, rischi sistemici.

Condividi sui Social Network:

Ultimi Articoli