OpenAI e Anthropic spostano la gara dal talento al costo per risposta corretta
Il 22 settembre 2026 i due principali produttori di AI hanno lanciato nuovi modelli puntando su prezzi più bassi e meno errori in produzione, non solo su prestazioni elevate
Per anni la competizione tra i grandi produttori di intelligenza artificiale si è misurata soprattutto con i benchmark: punteggi su test standardizzati, classifiche di ragionamento, capacità di risolvere problemi accademici. Il 22 settembre 2026, OpenAI e Anthropic hanno scelto quasi in simultanea un registro diverso: efficienza, costi per operazione completata, riduzione degli errori nei contesti reali. Non è un cambio di facciata. È un segnale che il mercato sta chiedendo qualcosa di diverso.
Due lanci, una sola direzione
OpenAI ha presentato GPT-6 Sol e GPT-6 Luna, due varianti del suo modello di punta pensate per fasce di prezzo più accessibili. L'idea centrale è che la qualità operativa — cioè quanto spesso il modello produce risposte sbagliate in contesti reali — possa migliorare mentre la spesa scende. Anthropic ha risposto con Claude Opus 5.5, puntando su una leva diversa: regole di comportamento più strutturate e la capacità di passare automaticamente a modelli meno avanzati quando una richiesta entra in aree sensibili, come la sicurezza informatica, senza rinunciare a un taglio dei costi nel lavoro quotidiano.
Il fatto che due aziende leader abbiano scelto lo stesso giorno per comunicare non è solo una coincidenza di calendario. Entrambe hanno cercato di spostare l'unità di misura della competizione: non più soltanto «quanto è capace il modello», ma «quanto costa usarlo in modo affidabile dentro processi reali» — customer support automatizzato, analisi di documenti, sviluppo software, assistenza alle decisioni aziendali. Quando un modello AI diventa un ingranaggio di un processo produttivo, un prezzo più basso per token o un benchmark migliore valgono solo se riducono il costo totale dell'operazione: meno correzioni umane, meno controlli manuali, meno tempo speso a gestire risposte imprecise.
Quanto costano davvero i nuovi modelli
Sul fronte dei prezzi, OpenAI ha reso esplicita la discesa. Nel registro ufficiale delle modifiche all'API, GPT-6 Sol viene indicato a 2 dollari per un milione di token in input e 10 dollari per un milione di token in output — con una tariffa ridotta a 0,20 dollari per i token già salvati in memoria (la cosiddetta cache). GPT-6 Luna scende ulteriormente: 0,10 dollari per un milione di token in input, 0,50 dollari in output, e appena 0,01 dollari per i token in cache. Per capire la scala: un token corrisponde approssimativamente a tre quarti di una parola in inglese, quindi un milione di token equivale a un testo molto lungo, come un romanzo di media lunghezza.
Questi numeri cambiano i conti di molti progetti ad alto volume: classificazioni automatiche, estrazione di dati da testi, risposte brevi, smistamento tra modelli diversi. In tutti i casi in cui un'azienda ha bisogno di «molte chiamate» piuttosto che di «una risposta perfetta», la riduzione di prezzo è concreta. OpenAI dichiara anche un miglioramento sulla correttezza delle risposte: su una valutazione interna basata su conversazioni reali — anonimizzate — in cui gli utenti avevano segnalato errori, GPT-6 Sol produrrebbe circa la metà degli errori del predecessore, con un'affidabilità paragonabile al modello di fascia alta GPT-6 Astra ma a costo molto più basso.
Secondo l'annuncio nella community degli sviluppatori, Sol e Luna sono disponibili in ChatGPT Work e in Codex — l'ambiente di sviluppo software di OpenAI — per vari livelli a pagamento; Luna è prevista anche per gli utenti gratuiti. Questo dettaglio non è banale: Work e Codex sono ambienti pensati per compiti lunghi e articolati in più passaggi, dove la cache e il riuso del contesto incidono molto più che in un normale scambio domanda-risposta.
Il prezzo per token è solo il punto di partenza: il costo reale si misura sulle operazioni completate con successo
Opus 5.5 e la scommessa sui guardrail
Anthropic, con il lancio di Claude Opus 5.5, ha scelto una narrazione parallela ma non identica. L'azienda sottolinea che Opus 5.5 richiede meno risorse di calcolo rispetto al predecessore Opus 5, e che il prezzo riflette questa efficienza: 4 dollari per un milione di token in input, 20 dollari per un milione in output, e 0,20 dollari per un milione di token letti dalla cache. È proprio la cache, sostiene Anthropic, a rappresentare la voce di spesa principale nel lavoro degli agenti AI e nel coding: se un'applicazione invia ripetutamente lo stesso contesto al modello, o mantiene attiva una sessione lunga, il costo non è solo nella generazione di nuovo testo, ma anche nella rilettura continua del contesto accumulato.
La differenza più strategica di Opus 5.5 riguarda però i meccanismi di sicurezza. Anthropic dichiara che il modello mantiene le misure di protezione delle versioni precedenti e, in alcuni casi, può passare automaticamente a modelli meno avanzati per richieste delicate. Quando i classificatori automatici rilevano richieste potenzialmente rischiose in ambito cybersecurity, Opus può redirigere verso un modello diverso, riducendo la probabilità che il sistema fornisca risposte utilizzabili per scopi offensivi. Per chi costruisce prodotti su questi modelli, questo introduce un equilibrio delicato: più protezioni significano più prevedibilità sul rischio, ma anche meno prevedibilità sull'esperienza d'uso. E cambia un aspetto spesso trascurato: l'auditabilità. Se il sistema può cambiare modello durante una sessione, l'azienda deve essere in grado di ricostruire quale modello ha risposto, con quali impostazioni e con quali limiti — una traccia che diventa essenziale nella gestione degli incidenti, nella governance interna e, sempre più, nella verifica della conformità normativa.
Il quadro normativo europeo cambia le regole del gioco
Dal 2 agosto 2026, l'AI Office e le autorità nazionali sono responsabili dell'applicazione del Regolamento sull'Intelligenza Artificiale — il cosiddetto AI Act. Per i fornitori di modelli di GPAI (modelli di uso generale, come quelli di OpenAI e Anthropic) scattano obblighi su trasparenza, gestione del copyright e misure di sicurezza. Non è un caso se in questa fase i produttori insistono su concetti come alignment, watermarking, audit e politiche di mitigazione: la qualità percepita non è più l'unico parametro, conta anche la capacità di dimostrare processi e controlli documentati. Per un'azienda italiana che vuole usare questi modelli in funzioni rilevanti — gestione documentale, supporto clienti, analisi legale — «fare le cose bene» si avvicina sempre più a un requisito operativo, non solo a un vantaggio reputazionale.
Tre fattori che ribaltano i conti
OpenAI parla di oltre il 50% di errori in meno rispetto al predecessore; Anthropic di una riduzione significativa dei costi grazie a un serving più efficiente e a una cache più economica. Sono riferimenti utili per orientarsi, ma nella pratica il costo non è mai solo il prezzo per token. Esistono tre variabili che possono ribaltare qualsiasi stima.
La prima è il numero di token per operazione. Un modello più discorsivo, o un agente che pianifica e produce passaggi intermedi, genera più testo e consuma più contesto. Si paga meno a token, ma se i token crescono, il costo per ticket risolto o per funzione implementata non scende nella stessa proporzione.
La seconda è la dinamica degli errori e delle correzioni. Se un modello riduce davvero gli errori, non si acquistano solo risposte migliori: si acquistano meno cicli di correzione, meno verifiche manuali, meno tempo speso a riformulare i prompt. È qui che la correttezza delle risposte diventa una metrica economica. Ma l'origine della valutazione conta: se il campione usato da OpenAI è costruito su conversazioni generiche, la domanda pratica è quanto assomigli ai casi d'uso reali — per esempio un sistema di RAG che interroga documenti aziendali, o un assistente di coding con accesso a repository di codice. La storia recente dell'AI generativa mostra che piccoli cambiamenti nel contesto cambiano molto il tipo di errore che emerge.
La terza variabile è il routing tra modelli. Per Anthropic è parte della sicurezza; per OpenAI, il prezzo molto basso di Luna rende accessibile un'architettura in cui una prima chiamata economica smista la richiesta e decide se inviarla a un modello più capace. È un approccio potente, ma introduce complessità: bisogna definire regole di smistamento, metriche di successo e strumenti di monitoraggio. In un contesto aziendale, il tempo di sviluppo e la governance diventano parte del costo totale tanto quanto i token stessi — quello che in gergo si chiama TCO.
Quando il prezzo scende, l'AI entra in processi che prima non erano economicamente sostenibili
Cosa cambia per le aziende italiane
I modelli stanno diventando più infrastruttura e meno evento. Quando il costo di accesso scende, non cambia solo la convenienza per chi vuole sperimentare: si abbassa la soglia per integrare l'AI in processi che prima non erano economicamente sostenibili. Un contact center può permettersi più passaggi di sintesi automatica; un team legale può fare una prima lettura automatica su più documenti; un reparto IT può usare l'AI per smistare richieste interne senza dover riservare il modello premium a ogni caso.
In Italia questo tende ad avere un effetto molto concreto: aumenta la probabilità che l'adozione si sposti dalle prove pilota all'uso quotidiano, soprattutto nelle PMI che hanno budget compressi ma una forte pressione a migliorare produttività e qualità del servizio. La parte delicata è che l'economia dell'AI «a consumo» è facile da avviare e difficile da governare: se l'uso cresce senza regole, la spesa diventa imprevedibile; se le regole sono troppo rigide, l'esperienza peggiora e gli utenti tornano a strumenti informali.
Ciò che OpenAI e Anthropic stanno cercando di comunicare, al di là degli sconti, è che l'efficienza è un attributo del modello, non solo del prezzo. OpenAI insiste sulla correttezza di livello alto portata su fasce più economiche; Anthropic insiste sul fatto che gran parte del costo reale di un agente sta nella cache e nel contesto, quindi l'efficienza va misurata dove il lavoro accade davvero. Sono due modi di dire la stessa cosa: il prodotto non è più solo il modello, ma il modo in cui si comporta dentro una pipeline reale, con memoria, strumenti, vincoli e controlli.
Per chi deve decidere se migrare o quale modello adottare, la domanda utile non è «qual è il migliore». È «qual è il più prevedibile nel mio flusso» e «quanto mi costa una risposta corretta». Il 22 settembre 2026 segna il momento in cui questa domanda smette di essere una preoccupazione solo finanziaria e diventa una metrica da team di prodotto. Ed è probabile che nei prossimi mesi la narrativa pubblica si sposti dai benchmark singoli a prove più vicine ai carichi di lavoro reali: ticket risolti, tempo risparmiato su documenti, incidenti evitati. I nomi dei modelli rischiano di diventare un dettaglio secondario, finché non si traducono in una differenza misurabile in produzione.