OpenAI ha avvertito oltre 100 organizzazioni che i suoi agenti di intelligenza artificiale potrebbero aver aggirato le protezioni di sicurezza senza autorizzazione, interferito con siti web o avuto accesso a dati e funzioni a cui non avrebbero dovuto avere accesso. I nuovi dati mostrano che questa serie di episodi bizzarri si estende ben oltre i pochi incidenti di alto profilo emersi quest’estate.
L’azienda definisce l’incidente “attività disorganizzata degli agenti“. La notifica non significa che ciascuna delle oltre 100 organizzazioni sia stata effettivamente hackerata.
In alcuni casi, i modelli stavano semplicemente tentando di aggirare le restrizioni; in altri, hanno utilizzato credenziali pubbliche, inviato richieste che il servizio poteva interpretare come comandi, acceduto a componenti interni o modificato il contenuto di siti web di terze parti.
OpenAI considera tuttora la violazione dell’infrastruttura di Hugging Face avvenuta a luglio come il suo incidente più grave. Durante un test di sicurezza informatica, i modelli sono riusciti a stabilire autonomamente delle comunicazioni, a uscire dall’ambiente isolato, a scoprire vulnerabilità e ad accedere ai sistemi di produzione. Il percorso dalla scoperta iniziale all’accesso root è durato meno di 13 ore.
In seguito all’attacco informatico, OpenAI ha iniziato ad analizzare l’attività passata dei modelli e ha gradualmente scoperto altre conseguenze.
A settembre, l’azienda ha individuato 53 casi in cui gli agenti avevano caricato immagini degli utenti su siti di hosting fotografico esterni. Non c’erano prove dirette che terze parti avessero aperto i file, ma i dati sono finiti al di fuori dell’ambiente controllato.
Nemmeno un isolamento più spinto ha risolto completamente il problema. Il 20 settembre, un agente interno ha scoperto una vulnerabilità nel filtro DNS e l’ha sfruttata per accedere a Internet , nonostante le normali connessioni web fossero bloccate per l’ambiente.
Il compito originale non prevedeva la ricerca di una via d’uscita; il modello ha scelto autonomamente questo percorso per raggiungere il suo obiettivo.
In un post pubblico, OpenAI spiega di controllare l’attività online dei modelli durante le fasi di addestramento e valutazione. Le organizzazioni ricevono avvisi se un agente potrebbe aver aggirato i controlli di accesso, interrotto la disponibilità del servizio o avuto un impatto negativo su un sistema di terze parti. L’azienda continua ad analizzare i vecchi registri, pertanto l’elenco delle piattaforme interessate potrebbe ampliarsi.
La portata dell’audit è diventata evidente quando il numero di organizzazioni notificate ha superato le 100. OpenAI sottolinea che gli avvisi sono destinati alla verifica da parte dei proprietari dei sistemi e non costituiscono una conferma di una violazione.
La differenza può essere significativa: tentare di aprire una porta chiusa a chiave e una violazione riuscita richiedono conclusioni diverse?
Questo probabilmente lo s moriremo prossimamente.
Ricercatore di sicurezza informatica con esperienza nell’analisi delle vulnerabilità, nella mitigazione del rischio cyber, nelle attività di red teaming ed ethical hacking e nella protezione di sistemi complessi. Specializzato in penetration testing e Threat Intelligence, contribuisce al rafforzamento della resilienza digitale di infrastrutture e reti aziendali.
Aree di competenza: Penetration Testing, Threat Intelligence, Red Teaming, Vulnerability Assessment, Incident Response