Immagine AI

Anthropic ha collegato la struttura dei prezzi di Claude Opus 5.5 al modo in cui gli sviluppatori stanno utilizzando Claude Code, con sessioni progressivamente più lunghe, più autonome e caratterizzate da una quantità di contesto molto superiore rispetto a pochi mesi fa. I dati aggregati raccolti tra marzo e settembre 2026 mostrano che il numero di prompt inviati all’interno di ogni sessione è rimasto sostanzialmente stabile, mentre è aumentato in maniera significativa il lavoro svolto dal modello per ciascun prompt: Claude opera oggi 3,3 volte più a lungo su ogni richiesta e genera oltre il 40% di chiamate al modello in più, mentre le interruzioni durante l’esecuzione sono diminuite del 68%. Nello stesso periodo gli sviluppatori hanno iniziato a collegare server di strumenti oppure a utilizzare skill con una frequenza circa doppia rispetto a sei mesi prima, mentre la quantità di testo incollata direttamente nei prompt si è ridotta di circa un terzo. Anche il contesto inserito in ciascuna richiesta è cresciuto di 2,6 volte e il rapporto tra token di input e token di output è passato da 189:1 a 324:1, indicando un utilizzo nel quale il modello riceve una quantità molto maggiore di codice, cronologia della sessione, istruzioni e informazioni provenienti dagli strumenti prima di produrre la risposta. Anthropic associa questo cambiamento alla progressiva adozione di Claude Code per attività più estese e meno rigidamente delimitate, nelle quali il modello può continuare a lavorare autonomamente per periodi più lunghi e mantenere in memoria una quantità crescente di informazioni. È proprio su questo tipo di utilizzo che la struttura tariffaria di Opus 5.5 dovrebbe produrre il maggiore risparmio: secondo Anthropic, un workload tipico fatturato a token costa circa il 40% in meno rispetto a Opus 5, mentre il modello genera inoltre l’output oltre il 30% più velocemente.

La riduzione deriva sia dal prezzo dei token sia soprattutto dalla gestione del prompt caching, componente particolarmente importante nelle sessioni di coding lunghe perché gran parte del contesto viene riutilizzata ripetutamente a ogni nuova chiamata. Opus 5.5 costa 4 dollari per milione di token di input e 20 dollari per milione di token di output, prezzi inferiori del 20% rispetto a Opus 5, mentre la lettura di token già presenti nella cache costa 0,20 dollari per milione, con una riduzione del 60%. Una cache read corrisponde quindi al 5% del costo di un token di input elaborato nuovamente. La scrittura dei token nella cache ha invece un costo pari a 1,25 volte quello dell’input ordinario nel caso della cache con durata di cinque minuti e a due volte il costo dell’input nel caso della cache da un’ora; ogni successivo accesso rinnova gratuitamente la durata della cache. Anthropic sottolinea che le letture dalla cache costituiscono una parte particolarmente rilevante dei costi nei workflow agentici e di programmazione, perché una lunga sessione può riutilizzare più volte lo stesso system prompt, la cronologia della conversazione, il codice precedentemente analizzato e le definizioni degli strumenti senza doverli elaborare nuovamente come input completo. Sui piani Pro, Max e Team il minore costo di Opus 5.5 viene riflesso anche nei limiti di utilizzo, che permettono di effettuare circa il 25% di lavoro in più rispetto a Opus 5; la riduzione aggiuntiva relativa specificamente alle cache read riguarda invece il pricing API. Anthropic sostiene inoltre che, al momento del rilascio, il costo di un token letto dalla cache con Opus 5.5 corrisponde a circa un quinto di quello dei modelli concorrenti considerati dall’azienda, mentre la società indica per il nuovo modello prestazioni superiori negli stessi scenari.

Parallelamente alla riduzione del prezzo, Claude Code è stato modificato per diminuire le situazioni nelle quali una modifica alla sessione invalida involontariamente la cache. Pur essendo aumentata di circa 2,6 volte la quantità di contesto elaborata per richiesta, nell’arco dei sei mesi considerati la percentuale di input che non riesce a utilizzare la cache è diminuita di oltre il 50%. Gli interventi riguardano sia eventi relativamente semplici, come il rinnovo dell’autenticazione durante una sessione, sia operazioni più complesse come l’aggiunta di nuove istruzioni nel corso della conversazione o il caricamento dinamico degli strumenti. Con Opus 5.5 e Claude Fable 5.1 è inoltre possibile modificare il livello di effort durante una sessione senza azzerare la cache già costruita, anche se questa funzione presenta alcune limitazioni: è disponibile usando una API key o un abbonamento Claude, ma non attraverso Amazon Bedrock, Google Cloud Agent Platform o un gateway delle Claude apps e non viene applicata quando è impostata la variabile CLAUDE_CODE_DISABLE_EXPERIMENTAL_BETAS oppure quando l’organizzazione utilizza una configurazione HIPAA. Gli sviluppatori che utilizzano API key o cloud provider possono inoltre impostare una durata della cache di un’ora, possibilità già disponibile agli abbonati. Per le conversazioni principali eseguite all’interno dei limiti inclusi nell’abbonamento Claude la durata predefinita è infatti di un’ora, mentre per usage credits, API key e cloud provider il valore standard rimane di cinque minuti; la durata maggiore può essere selezionata attraverso l’impostazione promptCacheTtl oppure tramite la variabile d’ambiente CLAUDE_CODE_PROMPT_CACHE_TTL, a condizione di utilizzare Claude Code 2.1.242 o una versione successiva. Anche i subagent creati tramite fork sono stati modificati per partire direttamente dalla cache della sessione principale: ereditano system prompt, set degli strumenti e cronologia completa della conversazione e la loro prima richiesta può quindi leggere queste informazioni dalla cache del processo padre invece di pagarne nuovamente l’elaborazione come nuovo input.

Anthropic attribuisce una parte ulteriore del risparmio alla capacità di Opus 5.5 di completare determinati compiti utilizzando meno turni e meno chiamate agli strumenti. Nei test riportati da Zeta Labs, il modello ha richiesto meno interazioni rispetto a Opus 5, ha operato con un costo prossimo alla metà e ha completato il doppio dei task classificati come più difficili. Il vantaggio non è però uniforme: per un’attività già ben delimitata, nella quale entrambi i modelli individuano rapidamente il percorso corretto, il numero di turni può essere molto simile e il risparmio deriva principalmente dal prezzo inferiore dei token; la differenza cresce invece nei task più aperti, nei quali un modello meno efficace può spendere numerose iterazioni seguendo un approccio sbagliato prima di correggersi. A questo si aggiunge l’aumento della velocità di generazione superiore al 30% rispetto a Opus 5, che non modifica direttamente il numero di token utilizzati o il tasso di cache hit ma riduce il tempo necessario per completare esecuzioni lunghe, soprattutto quando Claude continua a operare senza supervisione diretta dell’utente. Per mantenere elevata l’efficienza della cache durante queste sessioni, Claude Code consente di utilizzare /usage per verificare quale quota del contesto viene servita attraverso cache read; Anthropic raccomanda inoltre di selezionare il modello all’inizio della sessione evitando, quando possibile, di cambiarlo durante il lavoro, di eseguire la compaction prima di interrompere una sessione lunga anziché al rientro e, nel caso di utilizzo tramite API key o cloud provider, di attivare la cache della durata di un’ora per le attività destinate a protrarsi più a lungo. La combinazione tra prezzo inferiore dei token, cache read molto meno costose, minore frequenza di cache miss, condivisione del contesto con i subagent e riduzione dei turni necessari punta quindi specificamente a contenere il costo delle sessioni Claude Code nelle quali il modello mantiene grandi quantità di contesto e continua a lavorare per periodi sempre più estesi.

Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)

Di Fantasy