Xiaomi ha presentato la nuova famiglia di modelli di intelligenza artificiale MiMo-V2.6, composta da MiMo-V2.6-Pro e MiMo-V2.6-Flash e progettata per combinare capacità avanzate di ragionamento e programmazione con comprensione multimodale, ragionamento spaziale 3D e utilizzo diretto del computer. La nuova generazione amplia quindi il raggio d’azione dei modelli MiMo oltre i tradizionali compiti testuali e di coding, introducendo funzioni pensate per agenti capaci di costruire e modificare ambienti complessi, interagire con applicazioni e coordinare sequenze di operazioni differenti. MiMo-V2.6-Pro ha raggiunto un punteggio di 46,32 nell’Artificial Analysis Intelligence Index, un risultato indicato come il più alto ottenuto finora da un modello sviluppato in Cina e collocato su livelli comparabili a Grok 4.6, oltre che ai vertici tra i modelli con pesi aperti.
L’architettura utilizza un sistema Mixture of Experts da 1,02 trilioni di parametri complessivi, dei quali 42 miliardi vengono attivati durante l’elaborazione di ciascun input. Xiaomi ha concentrato una parte consistente dello sviluppo sull’espansione del reinforcement learning, applicando sia a MiMo-V2.6-Pro sia a MiMo-V2.6-Flash 750.000 traiettorie di addestramento e 30 fasi di apprendimento per rinforzo distribuite nell’arco di sei giorni. Il costo della fase di reinforcement learning è stato di 2,62 milioni di dollari per la versione Pro e di 850.000 dollari per Flash. L’azienda ha inoltre reso visibile in tempo reale il processo di addestramento, mostrando l’evoluzione delle prestazioni durante questa fase.
L’effetto dell’addestramento è particolarmente evidente nelle attività software di lunga durata. Nel benchmark DeepSWE v1.1, dedicato alla valutazione delle capacità di software engineering prolungato, MiMo-V2.6-Pro è passato da 58,4 a 72,57 punti dopo il reinforcement learning, mentre MiMo-V2.6-Flash è salito da 48,8 a 65,68. Il miglioramento è stato ottenuto aumentando contemporaneamente la dimensione dei batch, il throughput, la varietà degli ambienti di lavoro e la quantità di calcolo dedicata alla verifica dei risultati, con l’obiettivo di migliorare sia l’efficienza dell’apprendimento sia la capacità del modello di generalizzare a compiti differenti.
Particolare attenzione è stata dedicata anche al problema del reward hacking, cioè alla possibilità che un modello impari a sfruttare debolezze o scorciatoie presenti nel sistema di valutazione invece di sviluppare realmente la capacità richiesta. Xiaomi ha combinato progettazione delle ricompense, valutazioni avversariali, rilevamento delle anomalie e verifiche incrociate tra più sistemi di controllo, con lo scopo di limitare questo comportamento e aumentare sia la stabilità dell’addestramento sia l’affidabilità dei segnali di ricompensa utilizzati durante il reinforcement learning.
La società ha mantenuto per MiMo-V2.6 la struttura di prezzo API già adottata con la precedente serie V2.5, puntando quindi a conservare anche sul nuovo modello un rapporto particolarmente aggressivo tra prestazioni e costo. Secondo le misurazioni di Artificial Analysis, MiMo-V2.6-Pro presenta un costo di circa 0,13 dollari per attività dell’Intelligence Index ed è stato collocato sulla frontiera di Pareto che mette in relazione intelligenza del modello e costo per task. Il risultato combina quindi un punteggio vicino a quello dei modelli più avanzati con un costo operativo sensibilmente contenuto, mantenendo il posizionamento economico già adottato da Xiaomi per la generazione precedente.
Le capacità introdotte vanno però oltre il miglioramento nei benchmark di ragionamento e coding. Xiaomi riunisce ragionamento spaziale 3D, percezione multimodale e capacità di utilizzare il computer nel concetto definito “Vibe World”. Un utente può fornire testo, immagini o video e lasciare al modello il compito di suddividere la richiesta in più attività, coordinare diversi agenti, costruire scene tridimensionali e relative funzioni interattive, controllare il rendering e modificare iterativamente il risultato. L’approccio permette quindi di passare dalla generazione di codice alla costruzione e manipolazione di ambienti digitali complessi attraverso una sequenza coordinata di operazioni.
Tra le applicazioni mostrate figurano la creazione con Blender di oggetti e scene 3D, la produzione di asset destinati allo sviluppo di videogiochi e la realizzazione di ambienti per simulazioni robotiche. Il modello può inoltre utilizzare flussi provenienti da più telecamere per controllare un braccio robotico all’interno di un ambiente virtuale, identificando gli oggetti, afferrandoli e collocandoli nelle posizioni richieste. In questo scenario la componente multimodale non serve soltanto a interpretare immagini o video, ma viene integrata con pianificazione, ragionamento spaziale e controllo delle azioni necessarie per completare il compito.
MiMo-V2.6 è stato applicato anche alla produzione di documenti, presentazioni e contenuti multimediali. Con un’istruzione testuale molto breve può generare materiali didattici, report di ricerca e presentazioni destinate alla revisione di progetti di design. Nei flussi video può occuparsi della composizione delle scene, del movimento, della musica e del montaggio, mentre sul versante musicale Xiaomi ha mostrato esempi di composizione orchestrale e pianistica accompagnati dalla conversione della partitura in formato MIDI. Si tratta quindi di attività nelle quali più fasi di produzione vengono riunite all’interno di un singolo workflow gestito dal modello.
Sono state inoltre mostrate applicazioni scientifiche. MiMo-V2.6-Pro è stato utilizzato in un progetto relativo ai metal-organic frameworks, o MOF, destinati all’adsorbimento dei PFAS: il modello ha ricercato pubblicazioni scientifiche e brevetti pertinenti, proposto nuovi materiali candidati ed eseguito simulazioni per supportarne la valutazione. In ambito matematico è stato invece impiegato nella formalizzazione completa in Lean 4 del teorema di Li-Yorke secondo cui la presenza di un’orbita di periodo tre implica comportamento caotico. Il processo ha prodotto oltre 6.000 righe di codice Lean ed è arrivato fino alla verifica tramite kernel della dimostrazione formalizzata.
MiMo-V2.6-Pro e MiMo-V2.6-Flash sono disponibili attraverso AI Studio, MiMo Code, MiMo Desktop, la piattaforma MiMo API e OpenRouter, mentre i pesi dei modelli possono essere scaricati tramite Hugging Face. In parallelo Xiaomi ha rilasciato anche la versione definitiva di MiMo Desktop e introdotto la modalità Pro-UltraSpeed, progettata per mantenere una qualità equivalente a quella di MiMo-V2.6-Pro aumentando fino a 20 volte la velocità di generazione dell’output.
Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)
