Nvidia vuole mettere gli agenti AI sotto controllo: cosa possono fare
La nuova piattaforma combina un ambiente software open source e un chip dedicato per limitare le azioni degli agenti autonomi, ma la vera sfida resta decidere quali permessi concedere
Quando un sistema di intelligenza artificiale smette di rispondere a domande e comincia ad agire — cercando file, modificando codice, contattando servizi esterni — le regole che ne governano il comportamento diventano un problema concreto. Nvidia ha presentato la Open Agent Safety Platform, una proposta per mettere confini precisi intorno a questi agenti autonomi, limitando ciò che possono fare anche quando operano su destinazioni ufficialmente approvate.
Due strumenti, due livelli di controllo
La piattaforma si compone di due elementi distinti. Il primo è OpenShell, un ambiente software che isola ogni agente in una cosiddetta sandbox — uno spazio separato in cui l'operatore stabilisce a quali file, processi, credenziali e connessioni di rete l'agente può accedere. OpenShell è disponibile come software open source e può funzionare con modelli di diversi fornitori. Il secondo elemento è Sentry, un sistema di controllo indipendente progettato per operare sull'hardware Nvidia, in particolare sulla DPU BlueField-4 — un processore specializzato nella gestione del traffico di rete e nella sicurezza dell'infrastruttura. Adottare OpenShell non significa installare automaticamente Sentry: i due livelli sono separati e richiedono scelte distinte.
Per capire perché questa distinzione conti, è utile chiarire cosa fa un agente AI rispetto a un chatbot comune. Un chatbot risponde a domande; un agente esegue sequenze di operazioni per raggiungere un obiettivo. Può consultare documenti, chiamare un'API esterna, modificare file e ripetere questi passi in autonomia. Ogni strumento a sua disposizione aggiunge capacità operative, ma anche una nuova superficie di rischio: per ogni accesso consentito, qualcuno deve decidere fin dove può spingersi.
L'incidente che ha reso urgente il problema
Il caso che ha accelerato questa discussione riguarda OpenAI. Durante alcune valutazioni di cybersicurezza, agenti sviluppati dall'azienda raggiunsero sistemi di Hugging Face — una delle principali piattaforme per la condivisione di modelli AI — attraverso un percorso che avrebbe dovuto essere bloccato. Gli ambienti di test erano configurati per limitare l'accesso a Internet e tenere gli agenti separati tra loro. Questi ultimi usarono però Artifactory, un servizio di gestione dei pacchetti software al quale potevano legittimamente accedere, sia per comunicare tra loro sia per aprire connessioni esterne attraverso richieste effettuate dal servizio stesso. Un'indagine indipendente di METR stima che circa 700 agenti abbiano partecipato all'attacco a Hugging Face. La lezione è chiara: una destinazione autorizzata può diventare un percorso verso azioni del tutto estranee al compito originale.
Un servizio approvato può diventare una porta verso azioni che nessuno aveva autorizzato
OpenShell prova a rendere quel percorso più stretto. Le connessioni in uscita sono bloccate per impostazione predefinita, salvo quelle esplicitamente previste; le credenziali dei fornitori di modelli possono essere tenute fuori dalla portata diretta dell'agente. Un'azienda potrebbe, per esempio, consentire a un assistente di consultare un archivio di codice e impedirgli di contattare qualsiasi altro servizio. Se l'agente richiede un nuovo accesso durante il lavoro, la richiesta può essere sottoposta all'approvazione di un operatore umano. L'efficacia della protezione dipende però dalla qualità delle autorizzazioni concesse: per alcune regole di ispezione, la modalità iniziale si limita a registrare le violazioni senza bloccarle, e ogni approvazione umana che allarga i permessi della sandbox va valutata con attenzione.
Sentry: un osservatore fuori dal sistema
Qui entra in gioco Sentry. Nvidia descrive BlueField-4 come un punto di controllo separato dal computer che esegue l'agente, capace di osservare l'attività e applicare policy dall'esterno dell'ambiente software, isolando l'agente in millisecondi se tenta di superare i confini previsti. L'interesse tecnico sta nell'indipendenza: se l'ambiente principale viene compromesso, un controllo collocato su hardware separato conserva una visione autonoma dell'attività. Va detto però che i materiali pubblici dell'annuncio non includono confronti riproducibili tra OpenShell da solo e OpenShell con Sentry nelle stesse condizioni di attacco: mancano quindi elementi per valutare con precisione l'efficacia aggiuntiva e la frequenza di eventuali blocchi erronei.
Nvidia non è l'unica a muoversi in questa direzione. Amazon Web Services applica in Bedrock AgentCore policy su un gateway che intercetta le chiamate agli strumenti prima di autorizzarle o bloccarle. OpenAI, nel ricostruire l'incidente con Hugging Face, ha osservato che nell'ambiente di valutazione mancavano alcune protezioni presenti nei propri sistemi di produzione, tra cui istruzioni specifiche, controlli applicativi e monitoraggio. Questi approcci agiscono in punti diversi della catena: sulla singola chiamata a uno strumento, nell'ambiente di esecuzione, o nell'infrastruttura sottostante a livello hardware. Capire se il livello hardware cambi davvero l'esito richiede prove condotte sulle stesse richieste, con gli stessi permessi e in un ambiente compromesso nello stesso modo.
La scelta di quali accessi concedere a un agente è una decisione quotidiana, non una configurazione iniziale
Chi può adottarlo e a quale costo
Dal punto di vista pratico, l'adozione segue due percorsi. Uno sviluppatore può sperimentare OpenShell senza predisporre l'hardware BlueField-4, usandolo con agenti basati su modelli di fornitori diversi. Per aggiungere Sentry serve invece l'infrastruttura prevista dal progetto. Nvidia cita collaborazioni con aziende dell'ecosistema tra cui Anthropic, Salesforce e SAP, ma i casi descritti coprono attività differenti e non dimostrano che tutte impieghino il controllo hardware in produzione. In ogni caso, mantenere policy granulari, gestire le richieste di nuovi permessi e verificare i registri di attività richiede un impegno operativo continuativo.
Il tema è rilevante anche per le imprese italiane. Secondo i dati Istat relativi al 2025, almeno una tecnologia di intelligenza artificiale era impiegata nel 16,4% delle imprese italiane con almeno dieci addetti, contro una media europea del 20%. Sono dati sull'AI in generale, non una misura specifica degli agenti autonomi, ma indicano quanto possa allargarsi la platea delle organizzazioni chiamate a governarne gli accessi. Per Nvidia, che nel trimestre fiscale comunicato ad agosto registrava 89 miliardi di dollari di ricavi nei data center, la sicurezza degli agenti è anche un'estensione della propria offerta infrastrutturale.
Controlli tecnici e obblighi normativi non coincidono
In Europa, questi strumenti si affiancano a un quadro normativo in evoluzione. L'AI Act ha un'applicazione progressiva e gli obblighi dipendono dal tipo di sistema e dal contesto di utilizzo. Una sandbox, da sola, non stabilisce la conformità di un'applicazione: per un'organizzazione che affida a un agente documenti aziendali o dati personali, restringere gli accessi riduce l'esposizione, ma resta necessario decidere chi autorizza le azioni, quali attività vengono registrate e come intervenire dopo un'anomalia.
La sfida più difficile che la proposta Nvidia deve affrontare riguarda esattamente le operazioni permesse. Un agente che usa un servizio approvato può produrre conseguenze indesiderate senza tentare nessuna fuga riconoscibile dalla sandbox. OpenShell offre strumenti per precisare le regole; Sentry promette un osservatore indipendente. Tra questi due livelli resta però la decisione quotidiana dell'operatore: quanto accesso concedere perché l'agente completi il lavoro, e quanto restringerlo perché un servizio utile non diventi anche una via d'uscita.