SpaceXAI ha rilasciato Grok 4.7, nuovo modello di frontiera progettato soprattutto per coding, attività agentiche e knowledge work, mantenendo per la versione standard lo stesso prezzo e la stessa velocità di Grok 4.6. Il modello viene proposto a partire da 2 dollari per milione di token in input e 6 dollari per milione di token in output e, secondo i dati pubblicati dalla società, è stato sviluppato per lavorare più a lungo su problemi complessi, verificare con maggiore attenzione i propri risultati e gestire meglio sequenze operative estese. La nuova versione utilizza un base model più grande rispetto a Grok 4.6 ed è stata sottoposta a una fase di reinforcement learning più lunga e costruita su un insieme di compiti più difficili, con una maggiore presenza di attività che richiedono diverse ore per essere completate. SpaceXAI ha inoltre addestrato Grok 4.7 affinché comprenda nativamente il funzionamento del Grok Bot harness, migliorandone l’impiego nelle interazioni conversazionali e nelle attività generali di gestione delle informazioni, mentre tra i progressi dichiarati figurano anche una maggiore capacità di produrre documenti e presentazioni complesse.
Una parte importante del miglioramento riguarda quindi la capacità di sostenere flussi di lavoro prolungati, caratteristica sempre più rilevante nei sistemi agentici utilizzati per sviluppo software, analisi tecnica e automazione di attività professionali. Grok Bot, introdotto nell’agosto 2026, è stato concepito come un sistema di agenti persistenti dotati di un proprio ambiente di lavoro e capaci di operare all’interno di strumenti e applicazioni per periodi prolungati, mentre Grok 4.7 è stato esplicitamente ottimizzato per questo tipo di infrastruttura. Rispetto a Grok 4.6, presentato il 12 agosto 2026 come modello orientato a coding, agentic tasks e knowledge work, la nuova versione punta quindi non soltanto a migliorare la correttezza delle singole risposte, ma a mantenere maggiore coerenza durante processi che richiedono numerosi passaggi, uso di strumenti, verifica del lavoro svolto e gestione di contesti molto lunghi. Nella documentazione API, Grok 4.7 supporta input testuali e immagini con output testuale, livelli di reasoning low, medium, high e xhigh, Responses API e Chat Completions, function calling, ricerca sul web e su X ed esecuzione di codice. Il modello non prevede un limite testuale dichiarato per l’output e la documentazione consiglia l’utilizzo di meccanismi di prompt caching e context compaction nei loop agentici particolarmente lunghi, in modo da ridurre la ricomputazione del contesto e contenere i costi delle sessioni estese.
Sul fronte del coding, SpaceXAI riporta per Grok 4.7 un punteggio del 46,3% su CursorBench 4.0, benchmark orientato a compiti di programmazione di lunga durata, rispetto al 40,4% di Grok 4.6, al 41,7% di GPT-5.6 Sol e al 51,8% di Fable 5.1. Su DeepSWE v1.1, dedicato alla software engineering, Grok 4.7 raggiunge il 71,0% con livello di reasoning high, contro il 65,2% del predecessore, il 72,7% di GPT-5.6 Sol e il 70,0% di Fable 5.1. Il vantaggio rispetto alla generazione precedente risulta particolarmente marcato anche in Terminal-Bench 4.0, utilizzato per misurare attività eseguite attraverso il terminale su archi temporali di diverse ore: Grok 4.7 ottiene il 38,0%, quasi raddoppiando il 20,3% di Grok 4.6 e collocandosi vicino al 37,3% di GPT-5.6 Sol, mentre Fable 5.1 raggiunge il 57,9%. La società utilizza questi risultati soprattutto per sostenere il rapporto tra prestazioni, costo e capacità di sostenere attività di lunga durata, più che per presentare il modello come uniformemente superiore su ogni singolo benchmark.
I test pubblicati comprendono anche compiti professionali non limitati allo sviluppo software. Su AA Briefcase v1.1, che valuta attività d’ufficio eseguibili nell’arco di più ore, Grok 4.7 raggiunge un punteggio di 1.657, contro 1.546 per Grok 4.6, 1.487 per GPT-5.6 Sol e 1.678 per Fable 5.1. Sul Harvey Legal Agent Benchmark, dedicato al lavoro legale, il nuovo modello registra il 19,6%, rispetto al 15,8% di Grok 4.6, al 2,5% di GPT-5.6 Sol e al 6,7% di Fable 5.1, mentre su HealthBench Professional, relativo al ragionamento clinico, raggiunge il 56,7%, contro il 48,5% della generazione precedente, il 60,5% di GPT-5.6 Sol e il 62,1% di Fable 5.1. In EEBench, dedicato all’ingegneria elettrica, Grok 4.7 ottiene invece il 64,0%, migliorando nettamente il 53,0% di Grok 4.6 e superando nei dati pubblicati il 39,4% di GPT-5.6 Sol e il 56,4% di Fable 5.1. Un’ulteriore valutazione attraverso GDPval, utilizzata insieme ad AA Briefcase per simulare attività svolte da professionisti come avvocati, infermieri e analisti finanziari, assegna a Grok 4.7 un Elo di 1.695, rispetto a 1.605 per Grok 4.6, 1.735 per Fable 5.1 e 1.542 per GPT-6 Astra.
La differenza economica tra i modelli confrontati costituisce uno degli elementi centrali del posizionamento di Grok 4.7. SpaceXAI mantiene infatti il prezzo standard a 2 dollari per milione di token in input e 6 dollari per milione in output, gli stessi valori di Grok 4.6, mentre nella tabella comparativa GPT-5.6 Sol viene indicato rispettivamente a 4 e 20 dollari e Fable 5.1 a 10 e 50 dollari. Da questi valori deriva l’affermazione della società secondo cui Grok 4.7 può operare a circa metà del costo e con una velocità doppia rispetto ad alcuni modelli comparabili, pur mantenendo prestazioni competitive nei benchmark dedicati ai task prolungati. È disponibile anche Grok 4.7 Fast, che utilizza lo stesso modello su un’infrastruttura più veloce e raddoppia la velocità di output applicando però costi pari al doppio della versione standard. La variante Fast è disponibile soltanto in Cursor e Grok Build, non rientra nel livello gratuito di Grok Build e non viene offerta attraverso la API pubblica. Per il modello standard, invece, la documentazione indica anche un endpoint regionale statunitense che mantiene l’inferenza negli Stati Uniti applicando un sovrapprezzo del 10% sui token.
Una parte consistente del rilascio riguarda anche la sicurezza. Grok 4.7 utilizza un nuovo stack di salvaguardie e viene indicato da SpaceXAI come il proprio modello più resistente finora sia nei test sulle risposte da rifiutare sia nei tentativi di jailbreak. Nei domini dual-use, in particolare cybersecurity e biologia, l’obiettivo dichiarato è mantenere elevate capacità nei compiti legittimi evitando contemporaneamente di fornire assistenza per richieste pericolose. Sul benchmark di biosicurezza di LatchBio il modello raggiunge il 62,4%, mentre su HackerBench v0.3, benchmark interno dedicato a compiti cyber rischiosi o potenzialmente malevoli, avrebbe consentito il completamento soltanto del 3,3% dei prompt dual-use classificati come pericolosi, mantenendo allo stesso tempo un basso tasso di rifiuto per le attività di sicurezza legittime. L’architettura di protezione utilizzata sui modelli Grok combina addestramento al rifiuto, controlli applicati durante l’inferenza, misure comportamentali e monitoraggio successivo al deployment, con l’obiettivo di intervenire sia sulla singola richiesta sia su eventuali schemi di utilizzo avversario osservati nel corso di una sessione.
SpaceXAI ha inoltre iniziato a fornire a un numero selezionato di partner nel settore della cybersecurity un accesso su invito alle capacità di red teaming di Grok 4.7, destinato alla ricerca difensiva. Il modello è quindi pensato per mantenere capacità avanzate anche in scenari tecnici sensibili senza affidarsi esclusivamente a filtri che blocchino indiscriminatamente le richieste: l’obiettivo dichiarato è differenziare con maggiore precisione le attività di sicurezza legittime dai compiti con finalità malevole. Questo approccio si collega ai test svolti in precedenza sulla biosecurity con Grok 4.6 e alle procedure di valutazione interna ed esterna utilizzate da SpaceXAI prima e dopo il rilascio dei modelli, nelle quali valutatori terzi vengono affiancati ai controlli svolti direttamente dalla società.
Grok 4.7 è disponibile dal 21 settembre 2026 in Cursor e in Grok Build, dove viene utilizzato come modello predefinito del coding agent, oltre che attraverso la Grok API, harness di coding di terze parti, model router e piattaforme cloud. La documentazione elenca inoltre OpenRouter, Vercel e Cloudflare tra i gateway attraverso i quali il modello può essere utilizzato, mentre in Cursor è disponibile su tutti i piani. Grok Build permette di utilizzare gratuitamente la versione standard del modello e rappresenta uno degli ambienti principali per l’impiego agentico della nuova generazione, affiancando l’accesso via API destinato agli sviluppatori e alle integrazioni personalizzate. Con Grok 4.7, SpaceXAI prosegue quindi l’evoluzione avviata con Grok 4.5 e Grok 4.6 concentrandosi soprattutto su attività di lunga durata, software engineering, uso degli strumenti e lavoro professionale, mantenendo invariata la tariffazione base rispetto alla generazione precedente ma introducendo un modello di dimensioni maggiori, un addestramento più lungo e un nuovo sistema di salvaguardie.
Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)
