Immagine AI

Microsoft ha presentato MAI-Image-2.6, nuova generazione del proprio modello proprietario per la creazione di immagini da testo, ottenendo un forte incremento delle prestazioni rispetto alla versione precedente. Nel Text-to-Image Arena di LMArena il modello ha raggiunto un punteggio Elo di 1.336, posizionandosi al secondo posto assoluto dietro GPT Image 2 di OpenAI, primo con 1.381 punti. La distanza tra i due modelli è quindi di 45 punti, mentre Grok Imagine Image 2.0 di xAI occupa la terza posizione con 1.316 punti, 20 in meno rispetto al nuovo modello Microsoft. MAI-Image-2.5 aveva ottenuto 1.256 punti ed era decimo nella stessa valutazione: in una generazione Microsoft ha quindi guadagnato otto posizioni e circa 79 punti Elo complessivi.

Il miglioramento riguarda tutte le categorie valutate da Arena, ma è particolarmente evidente nelle attività che richiedono maggiore controllo sulla struttura visiva. Rispetto a MAI-Image-2.5, la generazione e modellazione di contenuti 3D registra un aumento di 114 punti, la generazione di persone migliora di 105 punti e il rendering del testo all’interno delle immagini guadagna 91 punti. MAI-Image-2.6 raggiunge inoltre il secondo posto nelle categorie dedicate a cartoon, anime e fantasy e in quelle relative a prodotti, branding e design commerciale, mostrando progressi anche negli utilizzi orientati alla produzione di asset professionali.

Microsoft ha lavorato contemporaneamente sulla rappresentazione del testo, sulla generazione delle persone, sulle strutture tridimensionali e sul fotorealismo. Il modello è stato ottimizzato anche per immagini di prodotto e branding e per composizioni dall’impostazione cinematografica, con l’obiettivo di produrre risultati utilizzabili in flussi creativi e commerciali. MAI-Image-2.6 introduce inoltre una gestione rafforzata di più immagini di riferimento e funzioni di grounding che permettono di collegare meglio le informazioni disponibili durante la generazione. L’utente può controllare con maggiore precisione anche il livello di reasoning utilizzato dal modello, il formato dell’output e la risoluzione dell’immagine prodotta.

Il risultato in Arena va comunque interpretato tenendo conto del metodo e della quantità di dati disponibili. LMArena utilizza confronti alla cieca nei quali agli utenti vengono mostrate due immagini generate dallo stesso prompt e viene chiesto quale preferiscano, trasformando successivamente i voti in punteggi e classifiche. Al momento della rilevazione MAI-Image-2.6 aveva raccolto 3.488 voti, mentre GPT Image 2 ne aveva accumulati più di 70.000. Per questo il secondo posto nominale di Microsoft presenta ancora un intervallo statistico corrispondente alle posizioni dalla seconda alla terza, mentre il primato di GPT Image 2 dispone di una base di valutazione molto più ampia.

MAI-Image-2.6 prosegue il rapido sviluppo della famiglia di modelli visuali proprietari di Microsoft. Dopo MAI-Image-1, introdotto nel 2025, l’azienda ha progressivamente rilasciato MAI-Image-2 e MAI-Image-2.5, aumentando in ogni generazione qualità visiva, aderenza ai prompt e capacità di produrre contenuti destinati a utilizzi creativi professionali. MAI-Image-2.5 aveva già segnato un salto significativo, raggiungendo il terzo posto per il text-to-image e il secondo nell’image editing al momento del lancio; la versione 2.6 porta ora la famiglia al secondo posto anche nella generazione pura da testo. Mustafa Suleyman, CEO di Microsoft AI, ha descritto questa progressione come il risultato di un lavoro continuo di miglioramento dei modelli sviluppati internamente.

MAI-Image-2.6 può già essere provato direttamente attraverso LMArena. Microsoft prevede inoltre di renderlo disponibile nel MAI Playground nel corso della settimana e successivamente di estenderlo a Microsoft Foundry e ad altri prodotti e servizi dell’azienda. Non sono stati ancora comunicati i dettagli necessari per valutarne completamente l’impiego enterprise, tra cui prezzi delle API, velocità di elaborazione, risoluzioni effettivamente disponibili e copertura geografica del servizio.

Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)

Di Fantasy