Immagine AI

Anthropic ha rilasciato Claude Sonnet 5.5, secondo modello della famiglia Claude 5.5 dopo Opus 5.5, mantenendo invariati i prezzi di Sonnet 5: 2 dollari per milione di token in input, 10 dollari per milione di token in output, 0,20 dollari per milione di token letti dalla cache e 2,50 dollari per milione di token scritti nella cache. Il nuovo modello genera output oltre il 30% più velocemente rispetto a Sonnet 5 e, secondo i test interni di Anthropic, richiede in genere meno token e meno chiamate agli strumenti per completare lo stesso lavoro, riducendo fino al 30% il costo effettivo per attività pur mantenendo invariato il listino per token. Sonnet 5.5 viene posizionato come complemento più rapido ed economico a Opus 5.5: quest’ultimo resta destinato ai problemi complessi e aperti che richiedono giudizio prolungato, mentre Sonnet 5.5 è ottimizzato soprattutto per attività quotidiane ben definite, correzione di bug, sviluppo software, iterazioni rapide e produzione di documenti, presentazioni e fogli di calcolo. Il modello è disponibile immediatamente attraverso Claude, Claude Code e la Claude Platform, oltre che su AWS, Google Cloud e Microsoft Azure, con identificativo claude-sonnet-5-5, e mantiene l’opzione zero data retention già prevista per Sonnet 5 e Opus 5.5. Claude Haiku 5.5, destinato invece ai workload ad alto volume e particolarmente sensibili ai costi, è previsto nelle settimane successive.

I benchmark pubblicati da Anthropic mostrano miglioramenti particolarmente marcati nel coding agentico e nel lavoro professionale. Su Terminal-Bench 4.0 Sonnet 5.5 raggiunge il 70,6%, rispetto al 10,3% di Sonnet 5 e al 66,4% riportato per Opus 5.5 in modalità Xhigh; su FrontierCode 1.1 ottiene il 46,2% a Max effort e il 52,1% a Xhigh, contro il 42,4% di Sonnet 5, il 54,4% di Opus 5.5 e il 49,3% di GPT-6 Sol, mentre su CursorBench 4.0 arriva al 55,5% rispetto al 34,1% del predecessore e al 57,8% di Opus 5.5. Nei test dedicati al knowledge work, GDPval-AA v2.1 assegna a Sonnet 5.5 un punteggio di 1844, appena due punti sotto Opus 5.5 e circa 400 punti sopra Sonnet 5, mentre AA-Briefcase v1.1 registra 1811 contro 1822 di Opus 5.5 e 1359 di Sonnet 5. Anthropic riporta inoltre il 64,5% su Humanity’s Last Exam con strumenti, l’80,1% con partial credit su OSWorld 2.1 e il 61,6% su Chartography senza strumenti; Sonnet 5.5 viene indicato anche come il primo modello Sonnet capace di completare Pokémon Red utilizzando esclusivamente screenshot. L’azienda sottolinea comunque che questi benchmark non rappresentano l’intero comportamento dei modelli e continua a considerare Opus 5.5 sensibilmente superiore per attività molto complesse, aperte e prolungate.

Una parte importante del miglioramento riguarda l’efficienza reale nei workflow. CodeRabbit ha riferito una migliore capacità di giudizio rispetto a Sonnet 5 accompagnata da una riduzione significativa dei token di output, mentre Base44, su 118 applicazioni reali, ha registrato una media di 3,6 iterazioni per build contro 7,7 con Opus 5 e il minor numero di tool call fallite tra i modelli confrontati. Nei test interni di Slack il modello ha utilizzato circa il 14% di token di output in meno senza modifiche ai prompt, Zendesk ha misurato tempi di elaborazione dei ticket inferiori del 20%, Box ha ottenuto risultati 2,4 volte più velocemente con il 12% di token complessivi in meno e Atlassian ha indicato per i propri Rovo Agents un incremento di velocità fino al 30% rispetto a Sonnet 5. Balyasny Asset Management ha inoltre rilevato su 2.441 task finanziari privati una media di circa 121.000 token per risposta contro 497.000 di Sonnet 5. Sonnet 5.5 introduce cinque livelli di effort ricalibrati — low, medium, high, xhigh e max — con Medium come impostazione predefinita in Claude Code e nelle app e High sulla Claude Platform. Anthropic segnala anche alcuni cambiamenti per chi migra da Sonnet 5: adaptive thinking è ora attivo per impostazione predefinita, disabilitarlo produce un errore 400, la scelta forzata degli strumenti viene sostituita da tool choice automatica combinata con strict tools e la soglia minima per il caching dei prompt scende da 1.024 a 512 token.

Sul fronte della sicurezza, Sonnet 5.5 è il primo modello della linea Sonnet a essere distribuito con gli stessi meccanismi di protezione cyber e fallback utilizzati sui modelli Anthropic più capaci, perché le sue prestazioni in cybersecurity vengono considerate paragonabili a quelle di Opus 5. Nei test riportati nel system card, il modello mostra capacità molto superiori a Sonnet 5 su exploit generation e scenari offensivi, motivo per cui Anthropic applica un sistema di controllo a più livelli composto da analisi delle attivazioni interne, un classificatore leggero integrato nel modello e un ulteriore classificatore basato su LLM; nei casi ritenuti ad alto rischio alcune richieste possono inoltre essere reindirizzate verso Sonnet 5. Le protezioni biologiche rimangono quelle già adottate con Sonnet 5, mentre Sonnet 5.5 introduce per la prima volta nella famiglia anche classificatori dedicati a impedire l’estrazione del reasoning interno. Nell’audit comportamentale automatico condotto su circa 1.850 scenari, Anthropic afferma che il modello migliora o eguaglia Sonnet 5 sulla maggior parte delle misure relative ad allineamento, resistenza agli abusi e affidabilità, senza superare nuove soglie previste dalla Responsible Scaling Policy. Il knowledge cutoff affidabile dichiarato è giugno 2026.

Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)

Di Fantasy