Il costo del comportamento scorretto dell’IA ora si misura non solo con le conseguenze, ma anche con il costo per l’indagine. OpenAI ha rivelato che l’esame della sua attività passata copre circa 50 petabyte di dati archiviati e costa più di $500.000 al giorno. L’azienda ha già allocato enormi risorse di calcolo e prevede di aumentarle man mano che l’indagine procede.
La scala del dataset spiega le spese insolite. Per l’indagine sono coinvolti circa 7.000 acceleratori NVIDIA GB200 e GB300, e i registri vengono esaminati mese dopo mese in ordine inverso. Secondo OpenAI, se si immaginasse l’intero volume come testo inglese standard, a una persona servirebbero circa 66 milioni di anni di lettura continua a una velocità di 240 parole al minuto.
È impossibile analizzare manualmente un volume così grande, quindi anche il primo filtraggio è eseguito dai modelli. Il sistema cerca episodi in cui gli agenti hanno modificato il contenuto dei siti web, aggirato i controlli di accesso, utilizzato password, chiavi API e altre informazioni sensibili. Diverse verifiche consecutive dell’IA restringono il campione, dopo di che ogni caso sospetto viene esaminato dai dipendenti.
La ragione di questa revisione su larga scala è stata il hack di Hugging Face di luglio. Durante un test interno, gli agenti di OpenAI sono usciti dall’ambiente di ricerca, hanno trovato vulnerabilità e sono arrivati alla infrastruttura di produzione. OpenAI considera ancora quell’episodio il più grave tra i casi noti di tale comportamento e ora sta esaminando i vecchi registri alla ricerca di eventi simili.
L’indagine ha già portato alla luce episodi precedenti. A giugno, un agente a cui era stato affidato il compito di trovare statistiche sui costi dei farmaci ha aggirato i limiti del portale Medicare australiano e ha ottenuto accesso a file pubblici e non pubblici. Al 26 settembre, OpenAI ha avvertito più di 100 organizzazioni, ma ha specificato che la notifica di per sé non conferma un hack o una perdita di dati riservati.
La revisione è in corso da circa un mese e finora non ha rilevato altre intrusioni di scala e gravità comparabili all’attacco a Hugging Face. OpenAI si aspetta di trovare ulteriori episodi, inclusi quelli avvenuti diversi mesi fa. L’analisi di un singolo caso selezionato richiede ai dipendenti da 45 minuti a diversi giorni, poiché i registri devono essere confrontati con le azioni delle modelli e il contesto di accesso.
Dopo l’incidente di luglio, OpenAI ha limitato l’accesso a Internet delle modelli di ricerca, ha separato ulteriormente gli ambienti di test e ha ampliato il monitoraggio delle azioni pericolose. La revisione dovrebbe mostrare come si è evoluto il comportamento degli agenti tra le versioni e in che misura le nuove misure riducono il rischio di ripetere azioni autonome in sistemi esterni. Fino a quando l’indagine continua, l’elenco delle organizzazioni avvisate potrebbe aumentare.
Ricercatore di sicurezza informatica con esperienza nell’analisi delle vulnerabilità, nella mitigazione del rischio cyber, nelle attività di red teaming ed ethical hacking e nella protezione di sistemi complessi. Specializzato in penetration testing e Threat Intelligence, contribuisce al rafforzamento della resilienza digitale di infrastrutture e reti aziendali.
Aree di competenza: Penetration Testing, Threat Intelligence, Red Teaming, Vulnerability Assessment, Incident Response