Immagine AI

Multiverse Computing ha lanciato Quasar 438B, il proprio modello di reasoning di punta destinato ad agenti AI su scala enterprise e applicazioni di coding. Si tratta del primo large model rilasciato direttamente dall’azienda, supporta inglese e spagnolo e raggiunge un punteggio di 43 nell’Artificial Analysis Intelligence Index v4.1.1, il risultato più alto ottenuto da un modello europeo all’interno del confronto considerato. Quasar dispone di 438 miliardi di parametri ed estende il lavoro di Multiverse Computing sull’efficienza dei modelli AI alla classe superiore ai 400 miliardi di parametri, con l’obiettivo di combinare capacità di ragionamento avanzate e tempi di risposta sufficientemente contenuti per l’impiego in sistemi interattivi.

Nell’Artificial Analysis Intelligence Index, Quasar 438B supera Mistral Medium 3.5, fermo a 30 punti, e NVIDIA Nemotron 3 Ultra, indicato a 38 punti. Il modello produce 500 token di output in 15,3 secondi includendo anche il tempo dedicato al reasoning. Soltanto tre modelli presenti nel confronto risultano più veloci e, tra questi, soltanto Gemini 3.7 Flash ottiene contemporaneamente un punteggio superiore nell’Intelligence Index. Mistral Medium 3.5 impiega invece 18,8 secondi per lo stesso volume di output pur ottenendo un punteggio inferiore di 13 punti rispetto a Quasar.

La latenza assume particolare importanza nei sistemi agentici, nei quali una singola richiesta può richiedere numerosi passaggi consecutivi. Un agente può dover pianificare un’attività, richiamare diversi strumenti, analizzare i risultati prodotti e modificare il proprio comportamento prima di completare il compito. Quando questo processo genera decine di chiamate al modello, anche piccoli ritardi accumulati a ogni iterazione possono trasformarsi in diversi minuti di attesa. Quasar è stato sviluppato proprio per mantenere più rapide queste sequenze operative senza rinunciare alle capacità di reasoning necessarie per affrontare attività complesse.

Sul benchmark Artificial Analysis Long Context Reasoning, AA-LCR, Quasar 438B raggiunge un punteggio di 75,0. Il test misura la capacità di recuperare, collegare e ragionare su informazioni distribuite all’interno di documenti di grandi dimensioni. Il risultato è equivalente a quello di Grok 4.6 nella configurazione high, si colloca a meno di un punto da Claude Opus 5 e supera NVIDIA Nemotron 3 Ultra di 4 punti e Mistral Medium 3.5 di 9,7 punti. Le capacità di elaborazione del contesto esteso sono destinate in particolare ad applicazioni enterprise nelle quali le informazioni necessarie possono trovarsi distribuite tra contratti, documentazione tecnica, policy interne, report o conversazioni precedenti.

Quasar ottiene inoltre 69,3 punti su Terminal-Bench v2.1, benchmark che valuta il comportamento degli agenti all’interno di veri ambienti terminale. Il risultato supera Mistral Medium 3.5 di 18,7 punti e NVIDIA Nemotron 3 Ultra di 15,4 punti. Terminal-Bench non misura semplicemente la capacità di produrre frammenti di codice, ma richiede al modello di lavorare attraverso sequenze operative realistiche che possono comprendere l’ispezione di repository, l’esecuzione di comandi, l’analisi degli errori e il completamento di più azioni collegate. Quasar rimane comunque distante dal risultato più elevato del benchmark, pari a 89,1 punti per Claude Opus 5, e Multiverse Computing indica proprio il coding agentico come una delle aree sulle quali proseguirà lo sviluppo del modello.

L’Artificial Analysis Intelligence Index v4.1.1 utilizzato per la valutazione aggrega nove benchmark suddivisi in quattro categorie. L’area Agents comprende GDPval-AA v2 e τ³-Banking, quella dedicata al coding utilizza Terminal-Bench v2.1 e SciCode, il reasoning scientifico viene valutato attraverso Humanity’s Last Exam, GPQA Diamond e CritPt, mentre conoscenza generale e ragionamento su contesti estesi comprendono AA-Omniscience e AA-LCR. Quasar supera i modelli europei comparabili in otto delle nove valutazioni considerate.

Il modello è stato progettato per organizzazioni che utilizzano agenti per lo sviluppo software, copiloti tecnici, sistemi di ricerca e automazione dei workflow. Le prestazioni ottenute su Terminal-Bench e nel long-context reasoning sono rivolte in particolare ad agenti che devono mantenere il contesto durante attività articolate, coordinare più azioni e completare processi composti da numerosi passaggi. Il tempo necessario per produrre 500 token punta contemporaneamente a rendere possibile l’integrazione di questi workflow all’interno di prodotti interattivi, anziché limitarli a elaborazioni asincrone o batch.

Il supporto nativo per inglese e spagnolo amplia inoltre l’impiego del modello all’interno di organizzazioni europee e internazionali che devono utilizzare lo stesso sistema di reasoning attraverso team e mercati differenti. Tra gli ambiti indicati figurano software engineering, automazione operativa, ricerca basata su grandi quantità di documenti e attività tecniche ad alta intensità di conoscenza, nelle quali capacità di mantenere il contesto, accuratezza e velocità di completamento incidono direttamente sull’utilizzabilità del sistema.

Quasar 438B è già disponibile attraverso la CompactifAI API di Multiverse Computing, consentendo alle organizzazioni di provare e integrare il modello senza dover predisporre direttamente l’infrastruttura necessaria alla sua esecuzione. L’API offre quindi l’accesso al modello come servizio e permette di inserirlo in applicazioni e workflow esistenti. Multiverse Computing ha inoltre annunciato che continuerà a sviluppare le capacità di Quasar dedicate al coding e ai sistemi agentici, con ulteriori aggiornamenti previsti dopo il lancio.

Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)

Di Fantasy