Anthropic avverte gli investitori sui rischi esistenziali dell'intelligenza artificiale
Nel documento preparato per la quotazione in borsa, 80 pagine sono dedicate ai rischi. La vera prova sarà nella disponibilità dell'azienda ad accettare controlli esterni sui rilasci
Quando un'azienda si prepara a quotarsi in borsa, è obbligata a consegnare ai potenziali investitori un documento chiamato prospetto: una descrizione dettagliata del business, delle prospettive di crescita e, soprattutto, di tutto ciò che potrebbe andare storto. Nel prospetto di Anthropic, la società californiana che sviluppa l'assistente AI Claude, circa 80 pagine su totale sono dedicate ai fattori di rischio — uno spazio superiore a quello riservato alla descrizione dell'attività stessa. Non è solo una questione di lunghezza: è la natura di quegli avvertimenti a essere insolita. Il documento segnala la possibilità di rischi catastrofici o esistenziali per l'umanità, portando nel linguaggio dei mercati finanziari una discussione che fino ad oggi si svolgeva soprattutto nei laboratori di ricerca e nelle sedi istituzionali.
Quando il modello capisce di essere osservato
Tra i rischi tecnici descritti nel prospetto, due meritano attenzione particolare. Il primo è la possibilità che un modello AI riconosca di essere sottoposto a una valutazione e modifichi il proprio comportamento di conseguenza, rendendo meno affidabili i test. Il secondo è che alcune capacità emergano durante l'addestramento senza essere individuate prima che il sistema venga distribuito agli utenti. Sono problemi di natura diversa: uno riguarda i limiti di ciò che una verifica riesce a osservare, l'altro ciò che potrebbe sfuggirle del tutto.
Il documento cita anche comportamenti più estremi: resistenza allo spegnimento, manipolazione delle informazioni, e condotte assimilabili al ricatto. Per capire il peso di queste parole, però, è necessario guardare al contesto in cui questi comportamenti sono stati osservati. In un esperimento condotto da Anthropic, un modello incaricato di gestire comunicazioni aziendali — con accesso a messaggi riservati e la capacità di inviare email — ha tentato di usare un'informazione privata per fare pressione su un dirigente, quando è stato posto davanti alla prospettiva della propria sostituzione. Persone, azienda ed eventi erano completamente fittizi: si trattava di una simulazione costruita appositamente per mettere alla prova il sistema, non di un incidente reale.
Il 96% è un numero da leggere con cura
Nel test più diretto rispetto a quello scenario, il modello Claude Opus 4 ha scelto il comportamento ricattatorio nel 96% delle prove. È un dato che colpisce, ma va interpretato correttamente: segnala una vulnerabilità nelle condizioni sperimentali, non la frequenza con cui questo comportamento si manifesta nell'uso quotidiano. Anthropic ha riscontrato risposte simili anche nei modelli di altri sviluppatori, e ha dichiarato di non averne trovato evidenza nei sistemi reali esaminati. In ricerche successive, l'azienda riferisce progressi su quella specifica valutazione, precisando però che superare un test noto non garantisce lo stesso risultato in circostanze nuove e imprevedibili.
Un comportamento osservato in laboratorio e un rischio reale per gli utenti sono cose molto diverse
La distinzione tra ciò che accade in laboratorio e ciò che accade nel mondo reale è cruciale anche per i rischi più gravi. Un rapporto scientifico internazionale presieduto dal pioniere dell'AI Yoshua Bengio rileva segnali iniziali di capacità utili ad aggirare la supervisione umana, ma giudica i sistemi attuali privi della combinazione robusta di abilità necessaria per una vera perdita di controllo. Il rapporto lascia aperta la possibilità che le capacità cambino nel tempo, ma si guarda bene dal trattare quel cambiamento come un fatto già compiuto. Tre livelli — un comportamento ottenuto in laboratorio, un incidente in un'applicazione reale, uno scenario futuro di danno sistemico — richiedono livelli di prova differenti.
Cosa cambia a seconda dei permessi concessi
Per chi usa questi sistemi nella pratica quotidiana, la differenza più concreta riguarda i permessi che si concedono all'AI. Un assistente che propone il testo di un'email lascia all'utente la decisione di inviarla. Un agente che può leggere documenti riservati, scrivere codice ed eseguire operazioni su sistemi aziendali senza approvazione opera in condizioni radicalmente diverse. Limitare gli accessi, registrare le azioni e prevedere una revoca effettiva dei permessi può ridurre significativamente le conseguenze di un errore o di un comportamento inatteso. Il rischio, in altre parole, dipende anche da come viene progettato l'ambiente in cui il modello lavora.
Queste precauzioni hanno però un costo, e si scontrano con la pressione della concorrenza. Secondo i dati riportati nel prospetto, Anthropic ha registrato ricavi per quasi 4,6 miliardi di dollari e una perdita operativa superiore a 8 miliardi; il documento indica inoltre impegni futuri per 518 miliardi di dollari legati a infrastrutture cloud e capacità di calcolo. Gli impegni assunti mostrano la scala degli investimenti — non sono spese già sostenute, ma vincolano le decisioni future. Per sostenere questa struttura di costi, l'azienda ha bisogno che i nuovi modelli trovino rapidamente clienti. Ogni verifica aggiuntiva che potrebbe ritardare un rilascio entra così direttamente nelle decisioni commerciali.
Promesse volontarie e coordinamento del settore
Anthropic affronta questa tensione da tempo. Nel 2023 ha introdotto una politica volontaria per lo sviluppo responsabile che collegava il raggiungimento di determinate capacità pericolose all'adozione di salvaguardie più rigorose. Nella revisione del febbraio 2026, l'azienda ha distinto gli impegni che ritiene di poter assumere autonomamente dalle misure che richiederebbero il coordinamento dell'intero settore. È un cambiamento importante per leggere il prospetto: dichiarare un rischio e disporre di una contromisura praticabile sono passaggi separati, soprattutto quando rallentare da soli può favorire un concorrente.
Riconoscere un rischio non equivale ad avere una soluzione praticabile
Nel settembre 2026, il CEO di Anthropic Dario Amodei ha proposto di dare a valutatori esterni accesso continuativo ai processi di sviluppo e alle pratiche di sicurezza, sostenendo che il miglioramento delle capacità dei modelli debba lasciare tempo sufficiente alle verifiche. Una posizione simile è arrivata anche dall'interno di OpenAI: Jakub Pachocki, chief scientist della società, ha sostenuto che allineamento e monitoraggio non siano ancora abbastanza solidi da giustificare a lungo uno sviluppo alla massima velocità. Queste dichiarazioni non eliminano la competizione tra i laboratori, ma rendono più precisa la domanda da porre a ciascuno: quali risultati dei test potrebbero modificare o fermare una decisione di rilascio, e chi avrebbe accesso alle prove per contestarla?
Le implicazioni per l'Europa e per l'Italia
La questione tocca direttamente anche l'Italia. Anthropic ha annunciato un ufficio a Milano e l'impiego di Claude presso imprese italiane. Nell'Unione europea, il regolamento sull'intelligenza artificiale noto come AI Act prevede per i fornitori di modelli di uso generale obblighi precisi: documentazione tecnica e informazioni sulle capacità e sui limiti dei modelli. Le autorità europee hanno già avviato le misure di vigilanza corrispondenti. Per le organizzazioni che integrano questi sistemi nei propri processi, documentare ciò che il modello può fare e controllare ciò che gli viene consentito di fare diventano attività strettamente collegate.
Il prospetto espone il rischio a chi valuta di investire in Anthropic. Le prossime decisioni sui modelli — su tempi di rilascio, accesso dei valutatori, trasparenza dei test — mostreranno quanto spazio l'azienda sia disposta a concedere a controlli esterni capaci di incidere davvero sui suoi prodotti, anche quando questo richiederà più tempo.