Immagine AI

Inworld AI ha lanciato Realtime TTS-2, un nuovo modello di sintesi vocale progettato per rendere le conversazioni con sistemi di intelligenza artificiale più naturali e sensibili al contesto. A differenza dei tradizionali sistemi text-to-speech, che trasformano principalmente un testo scritto in voce, Realtime TTS-2 analizza anche l’audio delle interazioni precedenti per ricostruire il modo in cui l’utente sta parlando, compresi tono, velocità e stato emotivo, adattando di conseguenza la risposta vocale successiva. Lo stesso testo può quindi essere pronunciato in maniera diversa a seconda della situazione precedente, per esempio dopo una battuta oppure dopo la comunicazione di una notizia negativa. Inworld ha presentato contemporaneamente due versioni: Realtime TTS-2, orientata soprattutto alla qualità della voce, e Realtime TTS-2 Flash, ottimizzata invece per latenza, grandi volumi di elaborazione ed efficienza economica.

Il sistema consente agli sviluppatori di definire il modo in cui la voce deve essere interpretata utilizzando direttamente istruzioni in linguaggio naturale. Indicazioni come [calm, reassuring] oppure [excited] possono essere inserite nel testo per specificare tono ed emozione, ma il controllo non è limitato a una serie predefinita di stati emotivi o a semplici parametri regolabili tramite slider. È possibile descrivere con frasi più articolate la situazione, l’intenzione e il tipo di interpretazione desiderata. Realtime TTS-2 supporta inoltre espressioni non verbali come risate, sospiri, respiri, tosse e sbadigli attraverso tag quali [laugh], [sigh], [breathe], [cough] e [yawn], che non vengono letti come parole ma trasformati in effetti vocali integrati nella pronuncia. Gli sviluppatori possono anche intervenire sulle pause, regolando con maggiore precisione ritmo della conversazione ed espressività.

Un’altra caratteristica riguarda la continuità dell’identità vocale tra lingue differenti. Realtime TTS-2 è in grado di mantenere la stessa voce in oltre 100 lingue anche quando il parlato cambia lingua all’interno della stessa generazione, preservando timbro, altezza e caratteristiche vocali. Nel complesso il sistema supporta più di 200 lingue e oltre 500 dialetti. Una frase può quindi passare, per esempio, dall’inglese allo spagnolo o al giapponese continuando a essere percepita come pronunciata dalla stessa persona. Il modello integra inoltre Advanced Voice Design, una funzione che permette di creare una nuova voce descrivendone in linguaggio naturale le caratteristiche desiderate, senza bisogno di fornire un campione vocale di riferimento.

È disponibile anche la clonazione vocale zero-shot. Utilizzando un campione audio della durata compresa tra 5 e 15 secondi, per il quale siano stati acquisiti i necessari diritti di utilizzo, il sistema può riprodurre la voce senza richiedere una fase di addestramento dedicata. Realtime TTS-2 e Realtime TTS-2 Flash combinano queste funzioni con il supporto alla generazione vocale multilingue e alle istruzioni di recitazione impartite in linguaggio naturale, permettendo di utilizzare la stessa architettura sia per la creazione di nuove identità vocali sia per la riproduzione di voci esistenti.

Le prestazioni in tempo reale rappresentano uno degli elementi centrali della piattaforma. Nei test condotti da Inworld, Realtime TTS-2 ha registrato una latenza inferiore a 100 millisecondi al 99° percentile. Realtime TTS-2 Flash, progettato specificamente per applicazioni che devono gestire grandi quantità di richieste, ha invece raggiunto nel benchmark Coval un tempo al primo byte di 25 millisecondi. Entrambi i modelli supportano lo streaming tramite WebSocket, caratteristica che permette di iniziare a riprodurre la voce mentre il contenuto viene ancora generato, riducendo il tempo percepito tra l’intervento dell’utente e la risposta del sistema.

Realtime TTS-2 ha ottenuto anche risultati elevati nelle valutazioni indipendenti di Artificial Analysis. Nel Controlled Voice Arena ha raggiunto un punteggio Elo di 1123, classificandosi al primo posto sulla base di 1.292 valutazioni e superando Sonic 3.6 di Cartesia, fermo a 1119 punti. Nel Provider Voice Arena ha invece ottenuto 1252 punti e il secondo posto, davanti a Qwen-Audio-3.0-TTS-Plus di Alibaba e Simba 3.2 di Speechify ma dietro a Sonic 3.6, che ha raggiunto 1282 punti.

Sul piano della velocità di generazione, Realtime TTS-2 è stato misurato a circa 106 caratteri al secondo. Sonic 3.6 raggiunge 124 caratteri al secondo, Simba 3.2 circa 97 e Eleven v3 circa 40. Inworld ha posizionato il modello anche su una fascia di costo inferiore rispetto a diversi concorrenti: Realtime TTS-2 viene proposto a 20,83 dollari per milione di caratteri, contro 49 dollari per Sonic 3.6, 100 dollari per Eleven v3 e 27,59 dollari per Qwen-Audio-3.0-TTS-Plus.

La tecnologia è pensata per applicazioni nelle quali la voce deve essere generata durante un’interazione e non preparata in anticipo, come personaggi AI, videogiochi, sistemi educativi, servizi di assistenza clienti e agenti vocali. Nei videogiochi basati sull’intelligenza artificiale, per esempio, le battute possono essere costruite dinamicamente in funzione delle decisioni dell’utente anziché essere selezionate da un insieme di dialoghi preregistrati, rendendo particolarmente importanti latenza, naturalezza della voce e capacità di riprodurre correttamente emozioni e intenzioni.

Inworld ha già indicato alcuni risultati derivanti dall’utilizzo delle proprie tecnologie vocali in servizi reali. Talkpal, piattaforma per l’apprendimento linguistico utilizzata da oltre 5 milioni di studenti e disponibile in più di 80 lingue, ha condotto un test A/B della durata di quattro settimane utilizzando Realtime TTS. Secondo i dati comunicati, il costo del TTS è diminuito del 40%, mentre l’utilizzo delle funzionalità è aumentato del 7% e la retention degli utenti del 4%. Status, servizio di simulazione sociale basato sull’intelligenza artificiale con oltre 500.000 utenti attivi giornalieri, ha invece riportato una riduzione dei costi legati all’AI di circa il 95%.

Realtime TTS-2 può essere utilizzato tramite le API di Inworld insieme ai servizi di riconoscimento vocale in tempo reale, alle Realtime API e alle funzioni di routing e inferenza della piattaforma. La Realtime API è inoltre compatibile con il protocollo Realtime di OpenAI, permettendo di integrare il sistema all’interno di ambienti già utilizzati per lo sviluppo di agenti vocali senza dover ricostruire completamente l’infrastruttura di comunicazione.

Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)

Di Fantasy