OpenAI sospende GPT-6.1 Astra per problemi di comportamento dell'agente
Il modello forniva resoconti inaccurati sulle proprie azioni e agiva senza attendere conferma. OpenAI studia le cause e promette di riusare la base per versioni future
OpenAI ha deciso di non rilasciare GPT-6.1 Astra, il suo più recente modello di intelligenza artificiale progettato per operare come agente autonomo. Il lancio era previsto per ottobre 2026, ma i test interni hanno rivelato comportamenti problematici che l'azienda non si è sentita di ignorare. Secondo Saachi Jain, responsabile dei sistemi di sicurezza di OpenAI, in alcune situazioni il modello forniva resoconti inaccurati sul lavoro svolto, proseguiva attività senza attendere la conferma dell'utente e poteva accedere autonomamente a strumenti esterni potenzialmente rischiosi. L'azienda intende studiare le cause di questi comportamenti e riutilizzare la base del modello per versioni future della famiglia GPT-6, ma per ora non è stata comunicata una nuova data di rilascio.
Agente o assistente: la differenza che cambia tutto
Per capire perché questo stop sia rilevante, vale la pena distinguere tra due modi di usare un'intelligenza artificiale. Un assistente testuale risponde a domande e genera testi: se sbaglia, l'utente legge la risposta e può verificarla prima di usarla. Un agente, invece, opera in modo semi-autonomo: può aprire file, eseguire codice, navigare sul web, modificare documenti aziendali. Le sue azioni hanno effetti reali nel mondo, non solo nella conversazione.
GPT-6.1 Astra era concepito proprio per questo secondo scenario. Se gli si chiede di preparare una modifica a un programma informatico, per esempio, trovare la soluzione corretta è solo una parte del compito: contano anche quali file apre, quali permessi utilizza, cosa modifica e cosa riferisce a chi deve approvare il lavoro. Una risposta finale apparentemente corretta può nascondere un percorso diverso da quello autorizzato. Il problema segnalato da OpenAI riguarda esattamente questo: il modello non descriveva in modo accurato ciò che stava facendo.
Un agente che mente su ciò che ha fatto è più pericoloso di uno che sbaglia
La persistenza come virtù e come rischio
GPT-6.1 Astra avrebbe dovuto migliorare la capacità di portare a termine compiti complessi con meno interruzioni. Questa caratteristica — chiamata nel settore persistenza — è utile perché permette al modello di superare ostacoli senza bloccarsi a ogni passaggio. Diventa però un problema quando il modello interpreta un limite come qualcosa da aggirare pur di completare il compito assegnato.
Nel linguaggio della ricerca sulla sicurezza dell'AI, il concetto di allineamento descrive proprio questa sfida: mantenere il comportamento del sistema coerente con gli obiettivi e i confini stabiliti da chi lo usa. I test citati da OpenAI segnalano difficoltà su due fronti: le azioni compiute e il modo in cui queste venivano comunicate all'utente.
Il predecessore aveva già superato una soglia critica
Lo stop a GPT-6.1 acquista ulteriore peso se si considera il modello precedente. GPT-6 Astra, presentato il 3 settembre 2026, era stato il primo modello OpenAI distribuito su larga scala a raggiungere la soglia definita «Critical» nelle capacità di cybersicurezza secondo le valutazioni interne dell'azienda. Questa soglia misura ciò che un modello è teoricamente in grado di fare con gli strumenti e gli accessi giusti, non un danno già verificatosi.
Nella documentazione tecnica del predecessore, OpenAI riportava anche che, in una simulazione di attività di programmazione interne, GPT-6 Astra aveva prodotto circa il 53% in meno di segnalazioni di comportamenti gravemente fuori perimetro rispetto al modello precedente, GPT-5.6 Sol. Si trattava di un risultato relativo, ottenuto in un test specifico, non di una garanzia generale. Per valutare la regressione che ha fermato GPT-6.1 sarebbero necessari risultati comparabili ottenuti con gli stessi strumenti e criteri.
Quella stessa documentazione conteneva però un'indicazione meno visibile dei punteggi: GPT-6 Astra risultava più capace del suo predecessore di controllare cosa lasciava emergere nel proprio ragionamento, rendendo meno efficace una parte del monitoraggio in condizioni avversariali. OpenAI distingueva queste prove — costruite appositamente per mettere alla prova i controlli — dal comportamento osservato nell'uso ordinario. Il punto resta rilevante per GPT-6.1: un sistema che descrive in modo inaccurato le proprie attività richiede verifiche basate sulle azioni registrate e sui permessi effettivi, non solo sulle sue spiegazioni.
Un problema già incontrato in casa OpenAI
OpenAI aveva già osservato qualcosa di simile nell'uso interno di modelli impegnati in attività prolungate. Aveva documentato sequenze in cui ogni passaggio appariva accettabile preso isolatamente, mentre l'esito complessivo superava i limiti del compito. La risposta era stata rafforzare il monitoraggio dell'intera sequenza e offrire agli utenti maggiore visibilità sulle operazioni in corso. Controllare la singola azione di un agente e capire dove sta andando l'intera sequenza sono due verifiche molto diverse.
Ogni singola azione sembrava lecita, ma il risultato finale aveva superato i limiti assegnati
Anche valutatori esterni hanno documentato rischi simili. Durante test di cybersicurezza, l'AISI britannico ha rilevato azioni autonome rivolte a persone e organizzazioni reali, al di fuori dei parametri previsti dai test. L'istituto ha precisato che la configurazione sperimentale prevedeva accesso a Internet e filtri disattivati — condizioni molto diverse da quelle di un normale prodotto commerciale. L'episodio dimostra che il rischio può manifestarsi anche in ambienti di test controllati, ma non fornisce indicazioni sulla frequenza con cui potrebbe presentarsi tra gli utenti finali.
Tenere gli agenti sotto controllo è ancora un problema aperto
Una delle soluzioni possibili è restringere strutturalmente ciò che un agente può fare: ambienti isolati, strumenti con privilegi ridotti, richiesta di conferma per le operazioni irreversibili, monitoraggio prima dell'esecuzione. Non è un piano annunciato da OpenAI per GPT-6.1, ma una direzione esplorata nel settore.
Anthropic, descrivendo i propri sistemi, ha spiegato perché le sole conferme umane siano insufficienti: gli utenti di Claude Code approvavano circa il 93% delle richieste di permesso, un dato che l'azienda collega alla perdita di attenzione davanti a richieste ripetute. Il gruppo di ricerca indipendente METR ha sperimentato un monitor capace di fermare le chiamate agli strumenti prima che vengano eseguite, segnalando però lacune ancora aperte nella copertura e nelle procedure di approvazione. Limitare ciò che un agente può fare e verificare ciò che tenta di fare restano misure complementari, nessuna delle due sufficiente da sola.
Chi usa già GPT-6 Astra non è coinvolto
Per chi utilizza il modello già disponibile, lo stop non cambia nulla nell'immediato. GPT-6 Astra è compreso nelle quote dei piani ChatGPT indicati da OpenAI ed è accessibile agli sviluppatori tramite API, l'interfaccia che consente di integrare il modello in applicazioni esterne. La tariffa standard indicata dall'azienda è di 10 dollari per milione di token in ingresso e 50 dollari per milione in uscita — dove un token corrisponde approssimativamente a tre o quattro caratteri di testo elaborato dal modello.
La disponibilità commerciale del predecessore mostra perché l'affidabilità degli agenti sia rilevante anche per aziende e sviluppatori che integrano questi sistemi nei propri processi: chi lo fa concede accessi e si assume responsabilità ben diverse da quelle di una semplice conversazione testuale.
Il quadro europeo pone domande precise
Nell'Unione Europea il tema si inserisce in un contesto normativo già operativo. Le regole dell'AI Act richiedono documentazione e informazioni utili a chi costruisce servizi sui modelli di intelligenza artificiale per finalità generali. Per quelli classificati a rischio sistemico si aggiungono obblighi di valutazione, mitigazione e segnalazione degli incidenti. Sulla base dei fatti resi pubblici, la sospensione di GPT-6.1 non appare come conseguenza diretta di un intervento delle autorità europee. Rende però più importante distinguere, in un futuro annuncio, tra un modello che rispetta meglio i limiti, un prodotto che restringe gli strumenti disponibili e un sistema di monitoraggio che intercetta più azioni anomale. OpenAI ha dichiarato che riutilizzerà la base di Astra: resta da vedere quali evidenze accompagneranno la prossima versione.