Immagine AI

SpaceXAI ha lanciato Grok 4.7, nuova generazione del proprio modello destinata soprattutto al coding, ai task agentici e al knowledge work complesso, a poco più di un mese dal rilascio di Grok 4.6. Il modello utilizza una base più grande rispetto al predecessore ed è stato sottoposto a una fase di reinforcement learning più lunga, costruita su un insieme di compiti più difficili e con maggiore peso assegnato alle attività che richiedono ore di lavoro. Lo sviluppo si è concentrato in particolare sulla capacità di mantenere il controllo di workflow prolungati, verificare in maniera più accurata le risposte e i risultati prodotti e gestire contesti estesi senza perdere coerenza durante l’esecuzione. La finestra di contesto rimane fissata a 500.000 token, con supporto per input testuali e immagini e output testuale. Grok 4.7 è disponibile attraverso Cursor e Grok Build, oltre che tramite API, piattaforme cloud, model router e harness di coding di terze parti. Il costo base rimane quello di Grok 4.6, pari a 2 dollari per milione di token in input, 0,50 dollari per milione di token recuperati dalla cache e 6 dollari per milione di token in output per prompt inferiori a 200.000 token; oltre questa soglia i prezzi raddoppiano. Sono disponibili livelli di reasoning low, medium, high e xhigh, mentre la variante Fast, proposta soltanto attraverso Cursor e Grok Build, raddoppia la velocità di generazione e anche il prezzo.

I miglioramenti più evidenti emergono soprattutto nei task agentici di lunga durata. Nell’AA-Briefcase di Artificial Analysis, benchmark dedicato al lavoro conoscitivo complesso che richiede produzione di deliverable e gestione di attività articolate, Grok 4.7 ha raggiunto 1657 Elo, con un incremento di 111 punti rispetto a Grok 4.6. Nel GDPval-AA ha ottenuto invece 1695 Elo, migliorando di 90 punti sul predecessore. Anche il coding mostra un avanzamento significativo: utilizzando Grok Build come harness nativo, Grok 4.7 ha totalizzato 56 punti nel Coding Agent Index, nove in più rispetto ai 47 ottenuti dalla versione precedente. Il miglioramento riguarda tutte le componenti principali della valutazione, con DeepSWE v1.1 salito dal 65% al 73%, Terminal-Bench 4.0 dal 18% al 33% e SWE-Atlas-QnA dal 58% al 63%. Questi risultati collocano la combinazione Grok 4.7 e Grok Build nelle posizioni più alte tra gli agenti di coding valutati con i rispettivi harness nativi, confermando che il salto generazionale è particolarmente marcato nelle attività in cui il modello deve programmare, eseguire più passaggi e verificare autonomamente il lavoro prodotto.

L’incremento non è però uniforme in tutti i benchmark. Nell’Artificial Analysis Intelligence Index, Grok 4.7 in modalità xhigh ha ottenuto 46 punti, soltanto due in più rispetto a Grok 4.6, mentre in alcune prove i risultati rimangono vicini a quelli del modello precedente. La versione 4.7 migliora di 4,5 punti percentuali in Terminal-Bench 4.0 e di 3 punti in GDP.pdf, ma registra anche una diminuzione di 3,7 punti in AA-LCR e di 1,1 punti in AutomationBench-AA. Il quadro mostra quindi un modello più efficace soprattutto nelle attività agentiche, nel coding e nei workflow di lunga durata, senza un avanzamento equivalente in ogni categoria di ragionamento. Artificial Analysis ha inoltre rilevato una riduzione del tasso di allucinazione nell’AA-Omniscience, passato dal 34% di Grok 4.6 al 29% di Grok 4.7 in modalità xhigh, mentre l’accuratezza complessiva è rimasta sostanzialmente stabile, passando dal 48% al 47%. L’indice complessivo della stessa valutazione sale comunque da 30 a 32, segnalando un miglioramento soprattutto nella calibrazione delle risposte più che in un aumento netto dell’accuratezza grezza.

Il progresso nelle attività più difficili comporta però un aumento rilevante del consumo di token. Nella configurazione xhigh, Grok 4.7 utilizza mediamente circa 81.000 token di output per ciascun task dell’Artificial Analysis Intelligence Index, contro circa 38.000 per Grok 4.6 e 27.000 per GPT-6 Astra. L’incremento rispetto al predecessore supera quindi il 100% e riflette direttamente il comportamento introdotto durante l’addestramento: il modello dedica più tempo al ragionamento, produce catene operative più lunghe e verifica ripetutamente il risultato prima di concludere il compito. Artificial Analysis ha misurato inoltre tempi medi di esecuzione elevati nei task dell’Intelligence Index, mentre nelle valutazioni degli agenti di coding Grok Build con Grok 4.7 richiede mediamente circa 39 minuti per task. Il miglioramento nelle prestazioni agentiche viene quindi ottenuto in parte attraverso un impiego molto più intenso del budget computazionale, con conseguenze dirette sui costi effettivi e sui tempi di elaborazione quando il modello viene utilizzato con i livelli di reasoning più elevati.

SpaceXAI ha lavorato anche sui sistemi di sicurezza, introducendo un nuovo safeguard stack progettato per distinguere con maggiore precisione le richieste realmente pericolose dalle attività legittime di cybersecurity. L’obiettivo è ridurre contemporaneamente la disponibilità del modello verso istruzioni dannose e i falsi positivi che portano al rifiuto di richieste tecniche lecite. Nei test HackerBench v0.3, la percentuale di richieste cyber dual-use pericolose accettate dal modello è stata contenuta al 3,3%, mentre nel benchmark LatchBio Grok 4.7 ha raggiunto 62,4 punti. SpaceXAI descrive il nuovo modello come la propria versione meglio calibrata finora sul fronte delle protezioni, collegando quindi l’aumento delle capacità operative a un controllo più specifico dei comportamenti ad alto rischio.

Elon Musk aveva già indicato che Grok 4.7 avrebbe rappresentato una fase intermedia rispetto al successivo Grok 4.8, citando anche la possibilità che durante il reinforcement learning della versione 4.7 fosse stata applicata una penalizzazione eccessiva alla lunghezza delle risposte. Grok 4.8 dovrebbe utilizzare un modello da circa 2,5 trilioni di parametri e viene indicato come il passaggio successivo nello sviluppo della famiglia. Grok 4.7 si presenta quindi soprattutto come un aggiornamento focalizzato sull’affidabilità nei workflow estesi, sull’autoverifica e sull’esecuzione di task agentici complessi, con progressi misurabili nel coding e nel lavoro conoscitivo ma accompagnati da un costo computazionale molto più elevato nelle configurazioni di reasoning più aggressive.

Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)

Di Fantasy