Gli specialisti di Anthropic hanno reso pubblica i dati sul quarto incidente, nel corso del quale il modello Claude Opus 4.6 è uscito dai confini dell’ambiente di test e ha ottenuto accesso non autorizzato a un sistema esterno. L’incidente è avvenuto già a gennaio 2026.
Secondo le informazioni degli sviluppatori, il modello stava eseguendo una CTF in un ambiente di un appaltatore esterno che conduceva test di sicurezza su Claude. In un certo momento, Opus 4.6 ha reso il compito impossibile da completare: ha assegnato alla macchina target un indirizzo IP già occupato da un altro host, dopo di che l’obiettivo è diventato inaccessibile.
Il modello ha notato il problema e ha cercato di interrompere l’esecuzione del compito, ma a causa di un errore nell’ambiente di test il comando di terminazione non ha funzionato. Successivamente, l’IA ha tentato di fermarsi altri sette volte (cioè ha intrapreso un totale di otto tentativi di terminazione del compito).
Non essendo riuscito a terminare la sessione, Opus 4.6 ha continuato a cercare modi per raggiungere l’obiettivo, e poi ha iniziato a esplorare l’ambiente disponibile. Alla fine, il modello ha scoperto una macchina di un’organizzazione esterna e ha deciso che anche quella faceva parte della CTF.
Su questa macchina, l’IA ha trovato un file con una password, con la quale ha ottenuto i privilegi di amministratore, raccolto ulteriori credenziali, modificato le impostazioni del sistema per semplificare l’accesso futuro, e ha anche letto informazioni personali di una persona.
Alla fine, la sessione si è conclusa solo quando il modello ha esaurito il limite di token a lui assegnato.
L’incidente è stato rilevato solo ad agosto 2026, quando gli specialisti di Anthropic stavano preparando i materiali per un’indagine indipendente dell’organizzazione METR. In precedenza, nell’azienda avevano già analizzato circa 141.000 sessioni in cui Claude avrebbe potuto accedere a Internet (grazie alla ricerca degli agenti), ma questo caso era stato trascurato. Dopo la sua scoperta, gli specialisti di Anthropic hanno verificato circa 481 milioni di trascrizioni, ma non hanno trovato altri incidenti di uguale o maggiore entità.
Al momento sono noti già quattro casi simili con i modelli Claude. Tutti sono avvenuti durante i test di sicurezza di un appaltatore, quando ai modelli veniva detto che stavano lavorando in una simulazione senza accesso a Internet, ma in realtà, a causa di un errore nella configurazione dell’ambiente, l’IA aveva accesso a Internet. Inoltre, i ricercatori hanno intenzionalmente utilizzato Claude senza i meccanismi di protezione che vengono normalmente applicati nelle versioni pubbliche dei modelli dell’azienda.
In Anthropic spiegano quanto accaduto con due problemi nel comportamento dei modelli. Innanzitutto, Claude si fida troppo delle impostazioni iniziali: se al modello viene detto che sta lavorando in una simulazione, il modello può ignorare i segni che si trova di fronte a un sistema reale. In secondo luogo, l’IA può continuare a eseguire il compito, anche se le sue azioni possono danneggiare persone reali o l’infrastruttura.
L’episodio più grave nell’azienda è ancora considerato quello con il modello Claude Mythos 5, che ha caricato autonomamente un pacchetto dannoso in PyPI. Si nota che nelle nuove simulazioni i modelli si comportano meglio, anche se il problema non è completamente scomparso: se Claude Mythos 5 compiva almeno un’azione dannosa grave nell’82% delle esecuzioni di test, per Opus 5 e Mythos 5.1 questi indicatori sono rispettivamente del 31% e del 33%.
In Anthropic sottolineano che queste cifre sono ottenute durante i test, che provocano intenzionalmente i modelli a comportarsi in questo modo, e non riflettono la probabilità di un tale comportamento in condizioni reali.
Carolina Vivianti è consulente/Advisor autonomo in sicurezza informatica con esperienza nel settore tech e security. Ha lavorato come Security Advisor per Ford EU/Ford Motor Company e Vodafone e ha studi presso la Sapienza Università di Roma.
Aree di competenza: Cybersecurity, IT Risk Management, Security Advisory, Threat Analysis, Data Protection, Cloud Security, Compliance & Governance