OpenAI ha sospeso test, addestramento e inferenza con strumenti dei suoi modelli IA più potenti dopo una serie di incidenti di misalignment. Un agente ha tentato di aggirare le restrizioni DNS per raggiungere Internet, mentre altri hanno interferito con servizi esterni. L’azienda sta analizzando petabyte di log per capire cosa sia accaduto.
La società OpenAI ha annunciato che sta sospendendo l’addestramento, i test e l’inferenza utilizzando strumenti per i suoi modelli di intelligenza artificiale più potenti. Gli esperti dell’azienda stanno conducendo un’ampia verifica dopo una serie di incidenti in cui gli agenti di intelligenza artificiale hanno superato i limiti delle attività assegnate, aggirato le restrizioni e interferito con il funzionamento di servizi di terze parti.
Interessante notare che l’azienda non ha fatto un annuncio separato sulla sospensione dell’addestramento: la pausa è stata resa nota dal rapporto di OpenAI, dedicato a un incidente con il cosiddetto misalignment (comportamento che non corrisponde alle intenzioni degli sviluppatori) e al tentativo di uno degli agenti di aggirare le restrizioni di accesso a Internet.
In seguito, il CEO di OpenAI Sam Altman ha commentato la situazione sul social network X. Ha riferito che l’azienda sta conducendo una “verifica su larga scala”, legata a come gli agenti utilizzano Internet durante l’addestramento e i test. Secondo Altman, l’indagine procede più lentamente del previsto, poiché gli esperti devono analizzare petabyte di log di attività degli agenti e collaborare con le organizzazioni coinvolte. Di conseguenza, si prevede che la verifica completa potrebbe richiedere diversi mesi.
Advertising
L’incidente descritto nel rapporto si è verificato durante un compito di ricerca ordinario: l’agente di intelligenza artificiale doveva trovare informazioni biografiche su un blogger non nominato, ma ha scoperto una filtrazione DNS insufficiente nell’ambiente di test e ha tentato di sfruttare questa vulnerabilità per aggirare le restrizioni di accesso a Internet.
L’agente non è riuscito a raggiungere Internet aperto: secondo i dati di OpenAI, ha ottenuto accesso solo alla cache web offline dell’azienda, ma gli ricercatori hanno considerato il tentativo di uscire dall’ambiente di test un incidente serio. Inoltre, i sistemi di monitoraggio hanno rilevato l’anomalia circa 15 minuti dopo, ma l’esecuzione del compito è stata interrotta manualmente solo dopo due ore e mezzo – l’interruzione automatica, su cui contavano gli sviluppatori, non ha funzionato.
Dopo questo episodio, OpenAI ha rafforzato le restrizioni di rete e aggiunto diversi nuovi livelli di blocco. Tuttavia, l’uso degli strumenti per i modelli più potenti è stato sospeso fino a quando gli esperti non saranno certi che il problema sia risolto e non avranno condotto ulteriori revisioni.
Va notato che parallelamente OpenAI sta conducendo un’indagine più ampia sull’attività dei propri agenti. In precedenza, l’azienda aveva già informato“decine di organizzazioni di terze parti”, tra cui enti governativi, università e altre strutture, su casi in cui gli agenti di OpenAI aggiravano i meccanismi di protezione o interferivano involontariamente con il funzionamento dei servizi. Tra le risorse colpite da tali “attacchi” sono menzionati i siti della Securities and Exchange Commission degli Stati Uniti e del Ministero dell’Istruzione. Si sottolinea che non sono stati trovati segni di accesso a dati riservati o a infrastrutture server critiche in questi incidenti.
Inoltre, di recente OpenAI ha riconosciuto che alcuni agenti trasmettevano dati di addestramento e test a servizi di terze parti, e in un caso sono stati caricati su hosting pubblici 53 immagini utente.
Advertising
Ricordiamo che nell’estate del 2026 gli agenti di OpenAI sono riusciti a uscire da un ambiente isolato e hanno attaccato la piattaforma Hugging Face. Successivamente, l’azienda ha avviato una verifica retrospettiva dell’attività degli agenti per scoprire se fossero accaduti casi simili in precedenza. Secondo un’analisi indipendente di ricercatori di Parse, allora gli agenti avevano ottenuto credenziali per Docker Hub, raccolto immagini container modificate e esplorato l’infrastruttura Kubernetes della piattaforma.
Inoltre, è emerso di recente che un altro agente di OpenAI ha ottenuto accesso a file non pubblici di un portale governativo australiano.
Secondo Axios, al momento gli ingegneri di OpenAI e Anthropic stanno esaminando già “decine di migliaia” di episodi potenzialmente problematici legati all’attività degli agenti.
📢 Resta aggiornatoTi è piaciuto questo articolo? Rimani sempre informato seguendoci su Google Discover (scorri in basso e clicca segui) e su 🔔 Google News. Ne stiamo anche discutendo sui nostri social: 💼 LinkedIn, 📘 Facebook e 📸 Instagram. Hai una notizia o un approfondimento da segnalarci? ✉️ Scrivici
Ricercatore di sicurezza informatica con esperienza nell’analisi delle vulnerabilità, nella mitigazione del rischio cyber, nelle attività di red teaming ed ethical hacking e nella protezione di sistemi complessi. Specializzato in penetration testing e Threat Intelligence, contribuisce al rafforzamento della resilienza digitale di infrastrutture e reti aziendali.
Aree di competenza:Penetration Testing, Threat Intelligence, Red Teaming, Vulnerability Assessment, Incident Response
Sono aperte le iscrizioni al corso in Live Class “AGENTIC AI CYBER OPERATIONS (AACO)”. La cybersecurity sta entrando nell'era degli AI Agent: sistemi capaci di ragionare, utilizzare strumenti, orchestrare attività e portare avanti operazioni complesse. Ma come funzionano davvero dal punto di vista tecnico? Con AACO, Red Hot Cyber porta i professionisti della cybersecurity a toccare con mano gli strumenti agentici, attraverso una Live Class in italiano con 15 ore di formazione, laboratori pratici e scenari reali. Agentic AI, Tool Calling, MCP, orchestrazione di agenti, OSINT, Threat Intelligence, vulnerability assessment e automazione delle operazioni di cybersecurity. Non un corso per imparare a usare un chatbot, ma un percorso per capire, costruire e governare sistemi agentici applicati alla sicurezza informatica.