Google ha presentato Gemini 4 Argon, nuovo modello frontier progettato per sostenere ragionamenti prolungati all’interno di workflow complessi e di lunga durata, con applicazioni concentrate soprattutto sull’ingegneria del software reale, sul lavoro professionale in ambiti come finanza e diritto e sulla difesa informatica. Il modello non viene distribuito immediatamente in maniera generalizzata: la prima fase di accesso riguarda un gruppo selezionato di operatori della cybersecurity attraverso il Fairwind Program di Google, mentre l’azienda continua a raccogliere valutazioni sul campo prima dell’apertura a sviluppatori, imprese e utenti. Google partecipa inoltre al processo volontario del governo statunitense per l’accesso ai modelli prima del rilascio, utilizzando questa fase iniziale anche per affinare le misure di sicurezza. Il prezzo introduttivo previsto per Argon è di 2 dollari per milione di token in input e 10 dollari per milione di token in output, mentre gli input memorizzati nella cache beneficiano di uno sconto del 95% rispetto al normale prezzo di ingresso. Terminato il periodo promozionale, le tariffe passeranno rispettivamente a 4 e 20 dollari per milione di token.
Gemini 4 Argon è già utilizzato internamente da migliaia di dipendenti Google per attività di programmazione specializzata, ricerca approfondita e produzione di testi, e alcune delle applicazioni sperimentate riguardano direttamente infrastrutture e progetti dell’azienda. Nel settore del quantum computing, il modello viene impiegato per ottimizzare le risorse spazio-temporali, espresse come qubit moltiplicati per gate, necessarie a sottoprogrammi che costituiscono colli di bottiglia per applicazioni più ampie: in uno dei casi riportati ha migliorato del 40% il precedente risultato pubblicato nell’arco di pochi minuti. Un gruppo di agenti basati su Argon ha inoltre analizzato automaticamente la telemetria di profiling dell’intera infrastruttura Google per identificare e applicare ottimizzazioni della memoria nei data center. Le modifiche già distribuite hanno liberato più di 300 TiB di memoria, mentre Google stima un risparmio complessivo potenziale compreso tra 500 TiB e 1 PiB.
Un altro impiego riguarda la migrazione di grandi codebase da C e C++ a Rust. Gli agenti Argon stanno lavorando su progetti che vanno da decine di migliaia di righe in librerie centrali come re2 e libgav1 fino a oltre 800.000 righe del kernel Zircon utilizzato dal sistema operativo Fuchsia. Poiché si tratta in molti casi di componenti critici, le riscritture vengono sottoposte a controlli automatici e manuali, test in emulazione e revisioni prima di qualsiasi distribuzione in produzione. Nel caso di libgav1, software open source di Google per la decodifica video, Argon ha preso una precedente implementazione Rust e ha sostituito 32.000 righe di codice SIMD attraverso ripetuti esperimenti guidati dai profili di esecuzione e dall’analisi dell’output del compilatore. Il nuovo codice Rust, realizzato in modo da consentire al compilatore di vettorializzarlo automaticamente, ha prodotto un decoder memory-safe 2,7 volte più veloce del precedente porting Rust, mantenendo identico l’output video e avvicinandone le prestazioni alla versione C++ ottimizzata.
Per sostenere attività di questo tipo Google ha aumentato in modo molto significativo il limite di output del modello, portandolo da 64.000 a 1 milione di token. L’obiettivo è permettere ad Argon di mantenere traiettorie di lavoro molto più lunghe, effettuare ragionamenti multipasso e produrre centinaia di migliaia di token all’interno di una singola esecuzione, evitando di spezzare necessariamente i problemi più complessi in numerose sessioni separate. Questa capacità viene combinata con competenze di coding, ragionamento e multimodalità e costituisce uno degli elementi alla base delle prestazioni dichiarate nei workflow professionali. Sul benchmark DeepSWE v1.1, dedicato a compiti di ingegneria del software reali e di lunga durata, Argon raggiunge il 77,9%. Il modello risulta inoltre al vertice del Vals Index, valutazione che misura l’impatto economico delle capacità AI in settori quali finanza, programmazione, attività legale e fiscalità ponderandoli sulla base del rispettivo contributo al PIL statunitense, e ottiene risultati analogamente elevati su Vals Finance Agent v2, dedicato alla ricerca finanziaria multipasso, e sull’Harvey Legal Agent Benchmark per ricerca e redazione in ambito legale.
Nelle attività aziendali end-to-end, Argon raggiunge invece il 51,3% su AutomationBench di Zapier, benchmark che valuta l’esecuzione completa di processi appartenenti alle principali funzioni operative di un’impresa. Le capacità multimodali vengono utilizzate anche per l’analisi professionale dei grafici, l’individuazione di informazioni all’interno di video molto lunghi e l’esecuzione di azioni sulla base di sequenze di documenti. Su LVBench, benchmark dedicato proprio alla comprensione di video di lunga durata, Google riporta un punteggio del 91,7%. L’obiettivo non è quindi limitare l’impiego del modello alla generazione di codice, ma consentirgli di combinare documenti, dati visuali, video e istruzioni operative all’interno dello stesso processo di lavoro.
Una parte rilevante dello sviluppo di Gemini 4 Argon riguarda la cybersecurity difensiva. Google lo ha addestrato affinché possa individuare autonomamente vulnerabilità software critiche, verificarne l’effettiva sfruttabilità e produrre le relative correzioni. Per i difensori considerati affidabili e per i team interni di Google, il modello viene messo a disposizione senza le normali cyber guardrail, in modo che possano utilizzare l’intero livello di capacità sviluppato per le attività di difesa. Wiz sta già impiegando Argon attraverso Scan for Good, iniziativa che offre gratuitamente protezione alle infrastrutture pubbliche critiche individuando e correggendo esposizioni ad alto rischio. In una delle prime applicazioni il modello ha scoperto una vulnerabilità critica che esponeva informazioni personali sensibili in software sanitari utilizzati da ospedali di diversi Paesi, individuando un rischio che precedenti modelli frontier non erano riusciti a rilevare.
Sul benchmark CWE-bench v1, che misura la capacità di correggere vulnerabilità di sicurezza, Gemini 4 Argon raggiunge il 68%, risultato che lo colloca a pari merito al primo posto secondo i dati comunicati da Google. Nei test interni dell’azienda il modello ha inoltre individuato esposizioni all’interno di codebase complesse sviluppate in 20 linguaggi di programmazione diversi. Un ulteriore confronto è stato condotto sul benchmark interno di penetration testing black-box di Wiz, nel quale il modello deve analizzare sistemi web reali senza disporre del codice sorgente: Argon ha superato Gemini 3.8 Flash Cyber nella ricostruzione della superficie di attacco, nell’identificazione delle vulnerabilità e nella produzione di proof-of-concept utilizzabili per verificarne concretamente l’esistenza. L’accesso iniziale a queste funzioni passa attraverso Fairwind, programma lanciato da Google il 2 settembre 2026 per governi e partner selezionati. Le organizzazioni partecipanti devono rispettare requisiti operativi specifici, tra cui limitare l’accesso al personale che opera internamente nella cybersecurity, nella risposta agli incidenti o nei penetration test e utilizzare protezioni come l’autenticazione multifattore. Il programma conta oltre 650 partner a livello mondiale e la sua prima offerta aveva combinato Gemini 3.8 Flash Cyber con l’harness CodeMender per individuare, verificare e correggere vulnerabilità.
Prima di estendere la disponibilità di Argon, Google sta lavorando parallelamente su quattro aree di sicurezza. La prima riguarda la prevenzione degli utilizzi impropri: il modello è progettato per rifiutare richieste dannose relative sia agli attacchi informatici sia ai rischi chimici, biologici, radiologici e nucleari, mantenendo però la possibilità di supportare attività scientifiche legittime a duplice uso secondo il Frontier Safety Framework di Google. L’azienda sta inoltre sviluppando tecniche per monitorare le attivazioni interne del modello alla ricerca di possibili segnali di uso improprio; queste protezioni sono state sottoposte a test di robustezza condotti da red team interni ed esterni attraverso attacchi sia manuali sia automatizzati. La seconda area riguarda le indirect prompt injection, nelle quali istruzioni malevole introdotte indirettamente nei dati o nel contesto tentano di deviare il comportamento del modello: Google descrive Argon come il proprio modello finora più resistente a questa categoria di attacchi e riporta prestazioni di primo livello sul benchmark Indirect Prompt Injection di Gray Swan, ottenute attraverso red teaming automatizzato e addestramento avversariale.
La terza area riguarda il monitoraggio del disallineamento durante l’esecuzione dei compiti. Google sta implementando sistemi che osservano il processo di ragionamento e le azioni di Argon e possono interromperne l’esecuzione quando il modello tenta di procedere oltre i limiti delle intenzioni dell’utente. Una metodologia simile è stata utilizzata durante l’addestramento, inviando eventuali segnalazioni a un team specifico di incident response e adottando precauzioni affinché i risultati del monitoraggio non venissero reinseriti direttamente nel training, evitando così di addestrare involontariamente il modello ad aggirare i sistemi di controllo. La quarta area riguarda infine gli ambienti di esecuzione: Google sta rafforzando le sandbox impiegate per training e valutazioni ad alto rischio, isolandole e sigillandole prima dell’avvio delle attività più sensibili in linea con la propria roadmap per il controllo degli agenti.
La distribuzione resterà quindi progressiva. Le valutazioni prodotte dai primi specialisti di cybersecurity e dagli altri tester selezionati serviranno a verificare il comportamento di Argon in scenari reali e a rafforzare i sistemi di sicurezza prima della disponibilità più ampia. Google prevede successivamente di estendere Gemini 4 Argon a sviluppatori, aziende e utenti, iniziando dai clienti API a pagamento e dagli abbonati a Google AI Ultra. Il modello viene posizionato per attività che comprendono coding, knowledge work professionale, difesa informatica e scrittura creativa, ma l’accesso generale arriverà soltanto dopo questa prima fase controllata di utilizzo e valutazione.
Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)
