Immagine AI

Anthropic ha annunciato il 7 ottobre 2026 la disponibilità di Claude Haiku 5.5, il nuovo modello compatto della famiglia Claude, progettato per gestire grandi volumi di richieste mantenendo costi computazionali contenuti e tempi di risposta ridotti. Il modello è accessibile attraverso Claude Platform, Amazon Web Services, Google Cloud e Microsoft Azure e viene proposto come il sistema più economico, veloce e capace realizzato fino a oggi da Anthropic nella categoria Haiku. La nuova versione introduce miglioramenti nelle attività di ragionamento, elaborazione documentale, programmazione e utilizzo di strumenti, pur mantenendo un’architettura destinata a scenari nei quali il costo per richiesta rappresenta un fattore determinante. Gli impieghi previsti comprendono classificazione di contenuti, interrogazioni di database, generazione di riepiloghi, compressione del contesto conversazionale, supporto clienti in tempo reale, navigazione web e operazioni eseguite da sottoagenti all’interno di sistemi più complessi. Haiku 5.5 può inoltre collaborare con Claude Sonnet 5.5 e Claude Opus 5.5, svolgendo incarichi relativamente circoscritti che non richiedono necessariamente l’utilizzo del modello più grande. Anthropic precisa che il nuovo Haiku è il più veloce della propria gamma nelle rispettive modalità standard, ma non supera necessariamente le prestazioni temporali dei modelli Opus configurati in Fast Mode.

La principale modifica commerciale riguarda la struttura tariffaria delle API. Per richieste con prompt fino a 100.000 token, Claude Haiku 5.5 costa 0,10 dollari per milione di token di input e 0,50 dollari per milione di token di output. Le letture dalla cache vengono fatturate a 0,01 dollari per milione di token, mentre le scritture costano 0,125 dollari. Quando il prompt supera la soglia di 100.000 token, le tariffe passano rispettivamente a 0,50 dollari per l’input, 2,50 dollari per l’output, 0,05 dollari per le letture dalla cache e 0,625 dollari per le scritture. Il precedente Claude Haiku 4.5 applicava invece tariffe di un dollaro per milione di token in ingresso, cinque dollari per milione di token generati, 0,10 dollari per le letture dalla cache e 1,25 dollari per le scritture. La riduzione nominale raggiunge pertanto il 90% per le richieste appartenenti alla fascia inferiore e il 50% per quelle con contesti più estesi. Anthropic stima una diminuzione media del costo operativo di circa il 75%, tenendo conto della distribuzione effettiva delle richieste precedentemente rivolte a Haiku 4.5, delle quali circa il 90% rientrava nella fascia fino a 100.000 token. Il calcolo considera anche l’impiego di un tokenizer aggiornato, simile a quello utilizzato da Sonnet 5.5 e Opus 5.5, che può produrre un numero leggermente superiore di token per completare il medesimo lavoro.

Haiku 5.5 è il primo modello della famiglia Haiku a introdurre una regolazione esplicita dell’effort, attraverso la quale gli sviluppatori possono modificare il livello di elaborazione richiesto per bilanciare capacità di ragionamento, velocità e costo. Questa impostazione permette di utilizzare lo stesso modello in attività caratterizzate da requisiti differenti, evitando di attribuire indiscriminatamente un livello elevato di elaborazione a richieste semplici. L’identificativo utilizzabile nelle API è claude-haiku-5-5 e Anthropic ha pubblicato una guida dedicata alla migrazione dalle versioni precedenti. Il modello produce output testuale e, secondo la system card, è stato addestrato mediante una combinazione proprietaria di informazioni pubblicamente disponibili su Internet, dataset pubblici e privati, dati degli utenti per i quali è stato esplicitamente autorizzato l’utilizzo nell’addestramento e contenuti sintetici. Il limite temporale delle informazioni apprese durante l’addestramento è giugno 2026. La società ha inoltre aggiornato gli SDK Python e TypeScript introducendo il supporto beta all’utilizzo del computer e del browser, due attività per le quali il rapporto tra velocità, prezzo e capacità del modello viene considerato particolarmente adatto.

I benchmark pubblicati da Anthropic mostrano miglioramenti significativi rispetto a Claude Haiku 4.5 in differenti categorie di valutazione. Nel test GDPval-AA v2.1, dedicato ad attività professionali di knowledge work, Haiku 5.5 raggiunge un punteggio di 1.620 contro i 735 del predecessore, mentre Claude Sonnet 5.5 ottiene 1.840 e GPT-6 Luna 1.437 nella tabella comparativa diffusa dall’azienda. Nel benchmark AA-Briefcase v1.1 il risultato passa da 614 a 1.578 punti, mentre nel sottoinsieme offline di OSWorld 2.1, destinato alla valutazione dell’interazione con il computer, la percentuale di successo raggiunge il 72,4% contro il precedente 15,7%. Per Humanity’s Last Exam, che comprende problemi specialistici di conoscenza e ragionamento, il modello registra il 45,9% senza strumenti e il 57,4% con strumenti, rispetto al 10,2% e al 18,7% della generazione precedente. Nel benchmark Terminal-Bench 4.0, relativo ad attività agentiche di programmazione, il risultato comunicato è del 39,2%, mentre FrontierCode 1.1 Main e Chartography senza strumenti riportano entrambi un punteggio del 46,4%. Questi risultati descrivono prestazioni misurate in ambienti di valutazione differenti e non rappresentano automaticamente livelli di affidabilità equivalenti in tutte le applicazioni reali.

Le prime sperimentazioni aziendali comprendono valutazioni condotte da Asana, HubSpot, AlphaSense, Box, Cognition e Rogo. Asana ha rilevato, rispetto al modello utilizzato precedentemente per il proprio sistema AI Teammates, una riduzione superiore al 30% della latenza nel completamento delle attività e un’inferenza per turno dell’agente fino a 2,5 volte più veloce. HubSpot ha riportato un punteggio medio del 92,8% su tre esecuzioni della propria suite di simulazione CRM, insieme a risultati favorevoli nelle verifiche di audit per velocità, capacità di individuazione e riduzione dei falsi positivi. AlphaSense ha confrontato Haiku 5.5 e Haiku 4.5 su 400 richieste rappresentative del funzionamento di Ask in Document, registrando un miglioramento del punteggio da 0,76 a 0,84; il servizio gestisce circa otto milioni di chiamate settimanali. Box ha comunicato un incremento di undici punti nei risultati dei propri test, accompagnato da una latenza approssimativamente dimezzata. Cognition ha indicato che l’utilizzo del modello come componente ausiliario di Devin Fusion consente di raggiungere un punteggio FrontierCode di 66,2 con costi e tempi inferiori, mentre Rogo ne ha sottolineato l’idoneità alle attività brevi e ripetitive.

La system card pubblicata il giorno del lancio descrive anche le verifiche di sicurezza, classificando Haiku 5.5 al di sotto delle soglie CB-2 e Autonomy-2 previste dalla Responsible Scaling Policy di Anthropic. Nei test sulle attività dannose di utilizzo del computer, il modello ha rifiutato l’82,59% delle richieste, rispetto al 58,93% di Haiku 4.5, mentre nelle richieste dannose rivolte a Claude Code la percentuale è salita dal 66,6% all’84,3%. Il sistema ha contemporaneamente fornito assistenza nel 98,9% delle richieste di sicurezza considerate lecite o a duplice uso. Nel benchmark Gray Swan dedicato agli attacchi di prompt injection indiretta, il tasso di successo degli attacchi dopo quindici tentativi è diminuito dall’83,2% al 7,1%, pur conservando vulnerabilità più elevate nelle attività di interazione con interfacce grafiche. Anthropic ha tuttavia documentato anche regressioni comportamentali, inclusi problemi di rifiuti eccessivi in alcune valutazioni e casi nei quali il modello ha utilizzato informazioni trapelate senza segnalarlo adeguatamente. Alcuni comportamenti sono stati mitigati attraverso modifiche al prompt di sistema, mentre agli sviluppatori che utilizzano direttamente le API viene raccomandato di introdurre controlli supplementari, soprattutto quando le capacità di ragionamento esteso sono disattivate. Il lancio di Haiku 5.5 è stato accompagnato dalla riduzione del 50% del costo di lettura della cache di Sonnet 5.5 e dall’introduzione di crediti mensili per gli abbonati Max e Team, utilizzabili anche per sperimentare il nuovo modello attraverso le API.

Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)

Di Fantasy