Immagine AI

Anthropic ha pubblicato una valutazione delle capacità cyber di GLM-5.3, il modello open-weight sviluppato da Zhipu AI, conosciuta fuori dalla Cina come Z.ai, sostenendo che abbia raggiunto livelli vicini a quelli mostrati in aprile da Claude Mythos Preview nello sviluppo autonomo di exploit end-to-end. Su ExploitBench, benchmark che misura la capacità dei modelli di sfruttare vulnerabilità note nel motore V8 utilizzato da Chrome, GLM-5.3 ha prodotto un exploit funzionante in 50 casi su 410 tentativi, contro 56 su 410 per Mythos Preview. In un secondo benchmark interno di binary exploitation basato su 100 attività relative a progetti open source presenti in OSS-Fuzz, GLM-5.3 ha ottenuto il completo controllo del flusso di esecuzione nel 4% dei casi, rispetto al 6% di Mythos Preview. Modelli precedenti come GLM-5.2 e Claude Opus 4.6 non avevano ottenuto alcun successo nello stesso test, segnalando quindi un aumento netto delle capacità della nuova generazione. Il NIST Center for AI Standards and Innovation aveva già definito GLM-5.3 il modello open-weight con le capacità cyber più elevate tra quelli pubblicamente disponibili, stimando comunque un ritardo complessivo di circa quattro mesi rispetto alla frontiera statunitense.

I test condotti da Anthropic con esperti umani hanno evidenziato capacità anche su vulnerabilità non precedentemente note. In una sessione durata meno di un giorno e condotta all’interno di una sandbox, GLM-5.3 ha individuato diverse vulnerabilità sconosciute nel motore JavaScript di un browser diffuso e le ha concatenate in un exploit capace di leggere file arbitrari dal computer della vittima attraverso una pagina web malevola; le vulnerabilità sono state poi comunicate al manutentore. Altri test hanno individuato falle potenzialmente sfruttabili in driver wireless e grafici e in software di dispositivi esposti alla rete. Anche la versione più piccola GLM-5.3-Flash ha mostrato capacità rilevanti: partendo da informazioni pubbliche su due vulnerabilità già conosciute, ha costruito una catena di exploit per sistemi ARM64 capace di superare le protezioni Pointer Authentication, richiedendo circa 20 minuti di attenzione da parte del ricercatore e otto ore di elaborazione del modello. Anthropic ha stimato che, ai prezzi API di Z.ai, l’intera operazione sarebbe costata circa 20,40 dollari.

La principale preoccupazione espressa da Anthropic riguarda però le protezioni contro l’abuso. GLM-5.3 dispone di meccanismi che normalmente rifiutano richieste esplicitamente dannose, ma il fatto che i pesi siano disponibili consente di modificarne direttamente il comportamento. Anthropic ha sperimentato una tecnica nota come “abliteration”, progettata per ridurre i meccanismi di rifiuto: dopo la modifica, il tasso di rifiuto del modello è passato da oltre il 90% a circa il 3% su JailbreakBench e HarmBench e al 12% su StrongREJECT, senza una riduzione significativa delle capacità scientifiche e con un calo limitato nelle valutazioni cyber. La procedura sperimentale ha richiesto circa 2.200 GPU-ore e 4.400 dollari di calcolo, anche se Anthropic stima che un team già esperto potrebbe ottenere un risultato simile con circa 600 GPU-ore e 1.200 dollari. Anche senza modificare i pesi, nei test simulati alcune tecniche relativamente semplici hanno aumentato fortemente la propensione del modello a eseguire richieste cyber malevole: presentare l’attività come un esercizio di red teaming ha portato all’esecuzione nel 64% dei casi, il prefilling del ragionamento nel 92% e la versione sottoposta ad abliteration nel 100%. I modelli Claude testati con le protezioni API attive non hanno invece eseguito gli stessi compiti nelle condizioni esaminate.

Anthropic sottolinea che le stesse capacità possono avere un valore molto elevato anche per la difesa, perché consentono di individuare vulnerabilità e correggerle prima che vengano sfruttate, e cita programmi come Project Glasswing attraverso i quali modelli avanzati sono stati messi a disposizione di ricercatori selezionati. La differenza individuata nel caso GLM-5.3 riguarda quindi soprattutto l’accessibilità: mentre modelli cyber particolarmente potenti come Claude Mythos vengono distribuiti attraverso programmi con accesso controllato, GLM-5.3 può essere scaricato, eseguito localmente e modificato da chiunque disponga dell’hardware necessario. Per questo Anthropic sostiene che modelli open-weight con capacità cyber di questo livello dovrebbero essere sottoposti anche a valutazioni indipendenti da parte di governi e organismi specializzati, considerando che la soglia delle capacità liberamente accessibili si è ormai avvicinata a quella raggiunta pochi mesi prima soltanto dai sistemi di frontiera sottoposti a controlli più restrittivi.

Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)

Di Fantasy