Immagine AI

Google ha introdotto Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS, due nuovi modelli text-to-speech disponibili attraverso Gemini API e Google AI Studio e progettati per coprire esigenze differenti nella generazione vocale. Gemini 3.8 Flash TTS è orientato alla direzione creativa, al character design e alla produzione di voci fortemente personalizzate per videogiochi, audiolibri immersivi, podcast e media interattivi, mentre Gemini 3.8 Flash-Lite TTS punta soprattutto sull’elaborazione ad alto volume e sull’efficienza dei costi, con scenari che comprendono doppiaggio, produzione di contenuti audio e agenti vocali. Entrambi i modelli consentono un controllo granulare su tono, ritmo ed espressività e si inseriscono nella più ampia famiglia Gemini Audio, che comprende già Gemini 3.5 Live Translate, Gemini 3.5 Transcribe e i modelli Gemini 3.8 Live e 3.8 Live Extended Thinking. Secondo la model card, i nuovi sistemi derivano da Gemini 3 Pro, accettano input testuali fino a 8.000 token e possono produrre output audio fino a 64.000 token, estendendo quindi l’utilizzo oltre clip vocali brevi verso contenuti lunghi e strutturati.

Una delle principali novità riguarda la possibilità di progettare una voce direttamente attraverso il linguaggio naturale. Gemini 3.8 Flash TTS può creare da zero profili vocali personalizzati definendo ruolo, accento e caratteristiche timbriche in oltre 100 lingue e dialetti, mentre la libreria disponibile viene ampliata dalle precedenti 30 voci a più di 2.000 voci pronte per l’impiego in produzione. La copertura include anche varianti regionali specifiche, come spagnolo messicano, francese del Québec e inglese scozzese, e le voci create possono essere salvate e gestite in modo da mantenere lo stesso profilo lungo progetti estesi. Google sta preparando inoltre una funzione di voice remixing destinata a modificare timbro, intonazione, velocità e accento delle voci della libreria senza doverne creare una completamente nuova. A queste capacità si aggiunge la voice replication, che permette di ricostruire un profilo vocale coerente a partire da un campione audio di circa 30 secondi appartenente all’utente o a una voce per la quale siano disponibili i diritti necessari. La funzione integra verifiche di consenso, watermark SynthID e credenziali C2PA, con l’obiettivo di rendere riconoscibili i contenuti sintetici e limitare l’impiego di campioni vocali senza autorizzazione.

Il controllo dell’interpretazione non si limita alla scelta della voce. I due modelli consentono di dirigere la performance riga per riga attraverso indicazioni esplicite inserite nello script oppure lasciando che Gemini ricavi automaticamente il tipo di resa da segnali presenti nel testo. È possibile intervenire su pause, ritmo, tono emotivo, cambi di dialetto e altri elementi della recitazione, mentre per dialoghi a due voci viene supportata una modalità nativa che gestisce direttamente scene multi-turno mantenendo separati i due interlocutori e cercando di preservare un turn-taking naturale. Gli script possono includere anche elementi non verbali e segnali conversazionali come risate, sospiri, sussulti e interiezioni brevi quali “mhm” o “yeah”, così da riprodurre dialoghi meno rigidi rispetto alla tradizionale sintesi vocale. Google dichiara inoltre che nei contenuti long-form il sistema riesce a mantenere qualità, ritmo e caratteristiche timbriche per ore di audio continuativo riducendo lo speaker drift, requisito particolarmente importante per audiolibri, podcast, doppiaggi e altri contenuti nei quali una variazione progressiva della voce diventerebbe facilmente percepibile.

Nei benchmark comunicati da Google, Gemini 3.8 Flash TTS ha ottenuto 71,4 punti nel Voice Design Benchmark di Hume AI, raggiungendo il primo posto complessivo, e 60,8 nella valutazione dedicata alla modellazione degli accenti. Gemini 3.8 Flash TTS e Flash-Lite TTS occupano inoltre rispettivamente le prime due posizioni nell’Overall Quality Index di Hume AI, mentre i confronti con Gemini 3.1 Flash TTS mostrano miglioramenti sia nella generazione long-form sia nel controllo di scene a due speaker. In valutazioni umane blind condotte tramite Voice Arena, i nuovi modelli hanno inoltre ottenuto le prime posizioni tra i sistemi confrontati in lingue come giapponese, portoghese brasiliano, vietnamita, arabo standard moderno, spagnolo messicano e hindi. Il rilascio amplia così un portafoglio audio che Google aveva già potenziato pochi giorni prima con Gemini 3.8 Live e 3.8 Live Extended Thinking, progettati invece per conversazioni speech-to-speech in tempo reale e capaci di mantenere il dialogo durante l’esecuzione di task, effettuare chiamate asincrone a strumenti e API, utilizzare input visivi e gestire dati alfanumerici complessi.

Sul piano della sicurezza, la replicazione vocale richiede che il proprietario della voce fornisca una registrazione di consenso che corrisponda allo speaker utilizzato come riferimento prima che il profilo possa essere generato. Tutti i contenuti audio prodotti dai modelli Gemini Audio incorporano inoltre SynthID, un watermark impercettibile inserito direttamente nell’output per permetterne la successiva identificazione come contenuto generato artificialmente. La model card segnala comunque alcuni limiti ancora presenti, tra cui possibili allucinazioni e occasionali rallentamenti o timeout, e indica gennaio 2025 come data di knowledge cutoff. Le valutazioni di sicurezza condotte da Google DeepMind non hanno rilevato nuove capacità significative o incrementi sostanziali rispetto a Gemini 3.7 Flash tali da raggiungere i Tracked o Critical Capability Levels definiti nel Frontier Safety Framework, motivo per cui i nuovi modelli non vengono considerati vicini a quelle soglie di rischio.

Gemini 3.8 Flash TTS è disponibile in Gemini API, Google AI Studio e Gemini Notebook, mentre Gemini 3.8 Flash-Lite TTS viene distribuito anche in Google Vids, dove può essere utilizzato per la generazione vocale collegata alla produzione video. L’accesso enterprise tramite API in Gemini Enterprise è indicato come in arrivo successivamente. Google AI Studio introduce inoltre un ambiente specifico per la progettazione audio, strutturato come un vero workspace di voice design nel quale è possibile creare nuove identità vocali, replicare una voce autorizzata e dirigere l’interpretazione riga per riga anche all’interno di sceneggiature a due speaker. La voice replication tramite AI Studio non è però disponibile in Illinois, Texas, Spazio Economico Europeo, Regno Unito, Svizzera e India. Attraverso Gemini API, i nuovi modelli sono già supportati da piattaforme per lo sviluppo di esperienze vocali come Agora, LiveKit, Pipecat e Vercel, mentre aziende come Figma, HeyGen, Linguana, Wondercraft, 99.co e Ollang stanno integrando le nuove capacità per doppiaggio globale, localizzazione dei contenuti, gestione di accenti regionali e agenti vocali conversazionali.

Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)

Di Fantasy