Microsoft AI ha presentato MAI-Transcribe-2-Streaming, il primo modello della famiglia MAI dedicato alla trascrizione audio in streaming, insieme ai nuovi modelli text-to-speech MAI-Voice-2.1 e MAI-Voice-2.1-Flash. MAI-Transcribe-2-Streaming è progettato per produrre trascrizioni in tempo reale a bassa latenza in 60 lingue, con rilevamento automatico e continuo della lingua parlata. Il sistema non attende che l’interlocutore abbia terminato la frase, ma genera le prime ipotesi di trascrizione poco più di 100 millisecondi dopo la ricezione dell’audio e le corregge progressivamente man mano che acquisisce nuovo contesto. Questo comportamento consente, per esempio, a un agente vocale di iniziare a elaborare una richiesta o ad avviare strumenti già mentre l’utente sta ancora parlando, oppure di mostrare sottotitoli e trascrizioni praticamente in contemporanea con la voce. Secondo i dati riportati da Microsoft sul benchmark di Artificial Analysis del 28 settembre 2026, il modello raggiunge un word error rate finale del 2,5%, un errore del 2,8% sulla prima trascrizione parziale e un tempo di 0,13 secondi per arrivare alla versione finale; nelle valutazioni interne dell’azienda, le parole comparirebbero inoltre nella trascrizione circa due volte più rapidamente rispetto al concorrente più vicino. Il benchmark AA-WER Streaming utilizza circa otto ore di audio provenienti da AA-AgentTalk, VoxPopuli ed Earnings22, comprendendo accenti differenti, terminologia specialistica e condizioni acustiche complesse.
Sul versante della sintesi vocale, MAI-Voice-2.1 supporta 23 lingue e 26 varianti locali e permette alla stessa voce di parlare in lingue differenti mantenendo l’identità dello speaker e adottando un accento nativo. Un assistente multilingue può quindi rispondere nella lingua utilizzata dall’interlocutore senza cambiare voce, mentre un’applicazione didattica può passare da una lingua all’altra durante la stessa lezione mantenendo lo stesso insegnante virtuale. MAI-Voice-2.1-Flash conserva queste capacità ma è ottimizzato per applicazioni ad alto volume e particolarmente sensibili alla latenza: può generare fino a 45 secondi di audio con una latenza end-to-end di circa 150 millisecondi e, secondo Microsoft, offre un’inferenza del modello più veloce del 55% e costi inferiori di circa il 60% rispetto a modelli comparabili. I prezzi indicati sono di 22 dollari per un milione di caratteri per MAI-Voice-2.1 e 15 dollari per un milione di caratteri per la versione Flash. Entrambi supportano inoltre la clonazione della voce utilizzando pochi secondi di audio di riferimento in tutte le lingue disponibili, con sistemi integrati di consenso destinati a limitarne gli abusi. In un Turing test condotto con 4.000 ascoltatori sui due modelli vocali, il 50,3% dei partecipanti ha giudicato le voci MAI altrettanto umane o più naturali rispetto alle registrazioni prodotte da persone reali.
L’abbinamento tra MAI-Transcribe-2-Streaming e MAI-Voice-2.1-Flash è pensato soprattutto per ridurre il tempo complessivo del ciclo conversazionale degli agenti vocali, dalla ricezione del parlato alla comprensione, alla decisione e infine alla risposta sintetizzata. Tra gli scenari indicati figurano sistemi di assistenza clienti capaci di trascrivere le richieste mentre vengono pronunciate e rispondere immediatamente con voce naturale, assistenti multilingue che riconoscono automaticamente la lingua utilizzata e applicazioni educative o multimediali con speaker distinti per tutoring, simulazioni, role-play, narrazione e contenuti conversazionali. MAI-Transcribe-2-Streaming viene proposto fino alla fine del 2026 con un prezzo introduttivo di 0,54 dollari per ora di audio e affianca il precedente MAI-Transcribe-2 non streaming. I tre nuovi modelli sono disponibili attraverso Microsoft Foundry, MAI Playground, Vercel e Azure Voice Live, mentre i due modelli vocali sono accessibili anche tramite OpenRouter e l’integrazione con LiveKit è prevista successivamente. Microsoft ha inoltre realizzato Chatter, una demo nel MAI Playground che combina trascrizione e sintesi vocale all’interno di un unico assistente conversazionale in tempo reale.
Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)
