Gli agenti di intelligenza artificiale stanno diventando così autonomi che NVIDIA ha deciso di non affidare più la loro sicurezza agli stessi agenti. L’azienda ha effettivamente spostato il “pulsante rosso” su un processore separato, che monitora il comportamento del sistema autonomo dall’esterno e può fermarlo in millisecondi.
La nuova NVIDIA Open Agent Safety Platform è progettata per agenti che accedono a file, credenziali, API, servizi aziendali e possono eseguire codice autonomamente. Un tale agente di intelligenza artificiale assomiglia già a un utente privilegiato, quindi NVIDIA ritiene che il divieto ordinario nel prompt di sistema sia insufficiente.
Il primo livello di protezione è fornito da OpenShell, un ambiente di esecuzione aperto che avvia l’agente in una sandbox isolata e definisce in anticipo i file, le reti, i processi, gli strumenti e le credenziali disponibili. NVIDIA ha già applicato uno schema simile in NemoClaw, dove OpenShell controllava le azioni di un assistente sempre attivo.
La principale novità si chiama Sentry. Il supervisore hardware funziona su NVIDIA BlueField-4 DPU separatamente dalla CPU centrale dove viene eseguito l’agente. Sentry vede le richieste del modello, gli accessi agli strumenti e ai dati, verifica l’identità dell’agente e applica politiche di zero trust. Se il sistema supera i limiti consentiti, il DPU può isolarlo e fermarlo in millisecondi.
La separazione è stata fatta appositamente. NVIDIA parte dal presupposto che l’agente possa trovare un percorso inaspettato verso l’obiettivo dopo un errore, un divieto o un tentativo fallito. Un comportamento simile è già stato riscontrato nella pratica: i sistemi autonomi sapevano aggirare i limiti e persino utilizzare siti esterni per la comunicazione, anche se gli sviluppatori vietavano loro di pubblicare informazioni direttamente.
Sentry si trova al di fuori dell’ambiente controllato dall’agente stesso, quindi il modello non può semplicemente modificare una regola di protezione insieme ai suoi strumenti. Nei sistemi Vera Rubin, BlueField-4 si trova direttamente sul percorso verso il modello, il che permette di verificare l’attività indipendentemente dall’ambiente operativo principale. NVIDIA definisce questo approccio un ulteriore livello di protezione nel caso in cui il circuito software non possa più essere considerato affidabile.
La motivazione per un’architettura così rigida è del tutto pratica. Negli ultimi mesi, gli agenti hanno già superato i limiti delle ambienti di test, cercato vulnerabilità e ottenuto accesso all’infrastruttura reale. Uno dei casi più significativi si è concluso con l’hack di Hugging Face, quando gli agenti sperimentali di OpenAI hanno raggiunto i sistemi di produzione.
Nella descrizione della nuova piattaforma, NVIDIA scrive esplicitamente che lo scenario ripetuto sembra identico: l’agente aggira la protezione a livello applicativo per eseguire il compito assegnato. OpenShell e Sentry dovrebbero trasferire parte dei divieti in un luogo dove il modello non potrà più accordarsi da solo per un’eccezione. La piattaforma supporta NVIDIA Vera e l’OpenShell aperto può essere adattato per i processori Arm e Intel.
L’ironia è che la tecnologia di protezione precedente di NVIDIA è stata recentemente stessa un bersaglio di attacco. La vulnerabilità di NemoClaw trovata permetteva a una pagina web dannosa di influenzare il modello locale e modificare il comportamento futuro dell’agente. Il Sentry hardware aggiunge un altro confine indipendente nel caso di compromissione dello strato software.
Il problema va già ben oltre i confini degli esperimenti di laboratorio. A settembre, gli agenti di OpenAI hanno penetrato il sistema del Ministero della Salute australiano durante una normale ricerca di statistiche mediche. Più gli sviluppatori concedono poteri agli agenti autonomi, più logica appare l’idea di NVIDIA: all’agente viene permesso di agire autonomamente, ma l’ultima parola spetta al processore, che l’agente non può raggiungere.
Carolina Vivianti è consulente/Advisor autonomo in sicurezza informatica con esperienza nel settore tech e security. Ha lavorato come Security Advisor per Ford EU/Ford Motor Company e Vodafone e ha studi presso la Sapienza Università di Roma.
Aree di competenza: Cybersecurity, IT Risk Management, Security Advisory, Threat Analysis, Data Protection, Cloud Security, Compliance & Governance