Anthropic ha introdotto una nuova politica di tariffazione per alcune richieste bloccate dai sistemi di sicurezza di Claude, con l’obiettivo di aumentare il costo economico degli attacchi di model distillation basati sull’invio massivo e ripetuto di prompt al modello. A partire dal 24 settembre 2026, una parte delle richieste respinte prima che Claude generi una risposta viene quindi conteggiata come una normale interazione a pagamento, anziché essere esclusa completamente dalla fatturazione. La misura arriva dopo che Anthropic ha rilevato nelle settimane precedenti una serie di attacchi organizzati contro i propri sistemi e viene presentata come uno dei diversi livelli di difesa introdotti per proteggere conoscenze, capacità e comportamenti interni del modello. Gli attacchi di distillazione possono infatti consistere nell’inviare grandi quantità di richieste a un modello più avanzato, raccoglierne sistematicamente le risposte e utilizzare successivamente questi dati per addestrare o migliorare un altro sistema; rendere economicamente onerose anche alcune richieste che vengono intercettate e bloccate prima della generazione riduce quindi il vantaggio di effettuare interrogazioni automatizzate su larga scala nel tentativo di aggirare le protezioni. Anthropic precisa comunque che il cambiamento dovrebbe interessare una parte estremamente ridotta dell’utilizzo normale: nei test recenti il 99,7% degli account che utilizzano Claude Code, il servizio web Claude e Claude Cowork non aveva prodotto nemmeno una delle richieste bloccate che ora diventano soggette a tariffazione. Il classificatore incaricato di individuare questi casi è stato inoltre regolato per mantenere il tasso di falsi positivi al di sotto dello 0,1%, anche se l’azienda riconosce che gli errori non possono essere eliminati completamente e prevede di continuare a perfezionare il sistema per limitare l’impatto sulle attività legittime.
La tariffazione varia in base al momento e alla categoria in cui interviene il rifiuto. Nel caso delle cosiddette pre-output refusals, cioè richieste che vengono bloccate prima che il modello inizi a generare testo, Anthropic applica il costo dei soli token di input quando il prompt rientra in quattro categorie considerate particolarmente rilevanti per la protezione del modello e dei sistemi avanzati: biologia, cyberattacchi, sviluppo di frontier LLM ed estrazione del processo di ragionamento. Le altre richieste respinte prima della generazione continuano invece a non essere tariffate. Il comportamento cambia quando il rifiuto avviene durante lo streaming di una risposta: in quel caso vengono fatturati normalmente sia i token di input già elaborati sia i token di output prodotti fino al momento dell’interruzione. Dal punto di vista dell’API, un rifiuto da parte del classificatore di sicurezza non viene restituito come errore HTTP tradizionale, ma come risposta HTTP 200 con il valore refusal nel campo stop_reason; i dettagli della risposta indicano inoltre quale area della policy abbia provocato il blocco. In questo modo gli sviluppatori possono distinguere in maniera strutturata un rifiuto di sicurezza da un problema tecnico e decidere di conseguenza come trattarlo all’interno dell’applicazione.
Anthropic ha affiancato alla nuova politica anche un meccanismo di fallback che permette di riprovare automaticamente la richiesta con un modello diverso quando quello inizialmente selezionato la rifiuta. Gli sviluppatori possono impostare fallbacks: "default" e lasciare che Anthropic scelga automaticamente un modello alternativo raccomandato in funzione della categoria di policy coinvolta, oppure specificare direttamente fino a tre modelli sostitutivi. Il fallback non annulla però il costo dell’interazione precedente: se il primo tentativo rientra fra le richieste rifiutate soggette a tariffazione, il relativo consumo viene conteggiato separatamente anche quando l’applicazione prosegue successivamente con un altro modello. La funzione è quindi pensata per mantenere più robusti i flussi applicativi e ridurre le interruzioni provocate da un rifiuto, ma senza eliminare la componente economica utilizzata da Anthropic come deterrente contro interrogazioni automatizzate e ripetitive.
La nuova politica non riguarda soltanto l’accesso diretto alle API di Claude, ma viene applicata anche quando i modelli Anthropic sono utilizzati attraverso piattaforme cloud esterne. La tariffazione delle richieste rifiutate interessate dal nuovo sistema viene quindi estesa anche ad Amazon Bedrock, alla piattaforma Claude di AWS, a Google Cloud e a Microsoft Foundry. Anthropic continuerà a misurare il tasso di falsi positivi del classificatore e ha precisato che le categorie soggette a pagamento potranno essere modificate nel tempo in base all’evoluzione degli attacchi e all’efficacia delle contromisure. La novità introduce così un meccanismo di difesa che non si limita a bloccare tecnicamente una richiesta considerata problematica, ma interviene anche sul costo dell’attacco: nei casi ritenuti più sensibili, chi invia grandi quantità di prompt continua a consumare risorse economiche anche quando Claude non restituisce il contenuto richiesto.
Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)
