Gemini 4 Argon, il nuovo modello frontier presentato da Google DeepMind il 30 settembre 2026, ha ottenuto risultati elevati in numerosi benchmark dedicati a software engineering, automazione, cybersecurity e attività professionali complesse, ma le prime valutazioni interne segnalano una possibile distanza tra le prestazioni misurate nei test standardizzati e quelle osservate nell’utilizzo quotidiano. Secondo persone con accesso diretto al progetto, alcuni dipendenti Google avrebbero riscontrato difficoltà nell’esecuzione di specifici compiti di programmazione e nella progettazione di interfacce front-end, nonostante i risultati pubblicati dall’azienda collochino Argon ai vertici in diverse prove. Google contesta tuttavia la caratterizzazione del modello come inferiore nel coding e sottolinea che migliaia di propri dipendenti lo stanno già utilizzando per attività specialistiche di sviluppo, ricerca e ottimizzazione dei sistemi interni. La divergenza riguarda quindi soprattutto il rapporto tra benchmark e comportamento del modello all’interno di progetti software reali, mentre l’accesso esterno rimane per ora limitato e non consente ancora una valutazione indipendente su larga scala.
Nei dati diffusi da Google, Argon raggiunge il 77,9% su DeepSWE v1.1, benchmark dedicato ad attività di software engineering complesse e articolate su più passaggi, contro il 74,2% di Claude Opus 5.5 e il 74,1% di GPT-6 Astra. Ottiene inoltre il 91,9% su Vibe Code Bench, davanti al 90,3% di Opus 5.5 e all’89,6% di Astra. Il quadro cambia però su altre prove di coding agentico: in FrontierSWE v2 Argon si ferma al 55%, rispetto al 65,5% di Astra e al 62,3% di Opus 5.5, mentre su Terminal-bench 4.0 raggiunge il 57,4%, contro il 66,4% di Opus 5.5. Sul PostTrainBench dedicato all’engineering dei modelli di machine learning ottiene invece il 45,3%, dietro al 49,3% di Opus. I risultati mostrano quindi prestazioni particolarmente forti in alcuni scenari di software engineering strutturato, ma meno uniformi quando il modello deve operare autonomamente in terminale, intervenire su repository complessi o affrontare attività agentiche meno vincolate.
Google sta già utilizzando Argon internamente su progetti di dimensioni molto superiori ai normali test di coding. Agenti basati sul modello stanno lavorando alla migrazione verso Rust di codebase C e C++, passando da librerie di alcune decine di migliaia di righe fino alle oltre 800.000 righe del kernel Zircon di Fuchsia; nel caso del decoder video open source libgav1, Argon ha inoltre sostituito circa 32.000 righe di codice SIMD attraverso iterazioni guidate dal profiling, producendo una versione Rust che Google dichiara 2,7 volte più veloce rispetto al precedente port mantenendo lo stesso output video. Altri agenti hanno analizzato dati di profiling dell’infrastruttura Google per individuare automaticamente ottimizzazioni della memoria, liberando oltre 300 TiB dopo il deployment e con un risparmio complessivo stimato tra 500 TiB e 1 PiB. Questi progetti vengono comunque sottoposti a verifiche automatiche, test di emulazione e revisioni manuali prima della distribuzione in produzione, quindi non rappresentano un’esecuzione completamente autonoma e priva di supervisione.
Argon è stato progettato per mantenere il ragionamento su attività lunghe e articolate e introduce un limite massimo di output di un milione di token, rispetto ai 64.000 delle precedenti configurazioni, caratteristica pensata anche per workflow estesi di sviluppo software e attività agentiche. Il modello è attualmente distribuito soltanto a un gruppo selezionato di operatori della cybersecurity attraverso il Fairwind Program, mentre Google prevede successivamente di estendere l’accesso a sviluppatori, imprese e utenti, partendo dai clienti API a pagamento e dagli abbonati Google AI Ultra. Fino alla disponibilità più ampia del modello, il confronto tra i risultati dei benchmark pubblicati da Google e le difficoltà segnalate nell’utilizzo pratico resta quindi basato principalmente su test interni e testimonianze di persone coinvolte nello sviluppo, mentre saranno necessarie valutazioni indipendenti su codebase e workflow reali per stabilire quanto le prestazioni misurate nei benchmark si trasferiscano effettivamente alle attività quotidiane di software engineering.
Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)
