Immagine AI

Kakao ha aggiornato la tecnologia di generazione vocale di Kanana-o, il proprio modello omni progettato per comprendere e produrre differenti modalità di contenuto. La nuova versione consente di definire il modo in cui una frase deve essere pronunciata utilizzando istruzioni formulate direttamente in linguaggio naturale, senza dover impostare separatamente parametri tecnici o ricorrere a modelli vocali specifici per ogni stile espressivo.

Il sistema può modificare velocità, volume e altezza della voce, ma anche riprodurre emozioni, inflessioni, intensità e caratteristiche regionali della pronuncia. Le richieste possono contenere indicazioni semplici, come leggere un testo molto velocemente o con una voce triste, oppure combinazioni più articolate. Kanana-o può per esempio ricevere l’istruzione di parlare con accento della regione sudcoreana del Gyeongsang nello stile di una telecronaca sportiva, oppure di abbassare il tono, aumentare la velocità e mantenere contemporaneamente un’espressione malinconica.

La capacità del modello di rispettare le istruzioni vocali è stata misurata attraverso InstructTTSEval, un benchmark coreano dedicato alla valutazione dei sistemi text-to-speech controllabili tramite comandi. Kanana-o ha ottenuto 94,50 punti, superando i 91,10 punti attribuiti a GPT-4o-mini-tts e avvicinandosi ai 95,38 punti di Gemini 2.5 Flash Preview TTS. Il risultato misura la corrispondenza tra l’indicazione fornita dall’utente e le proprietà effettivamente presenti nella voce generata.

L’aggiornamento interviene anche sulla velocità e sull’efficienza del processo di sintesi. Kakao ha introdotto LM-SPT, un tokenizzatore vocale proprietario capace di comprimere e rappresentare il parlato con un numero inferiore di token. Riducendo la quantità di dati che il modello deve elaborare, il sistema può generare la voce più rapidamente e utilizzare in modo più efficiente le risorse di calcolo, senza rinunciare alla qualità acustica o alla capacità di seguire istruzioni complesse.

LM-SPT è stato confrontato con tecnologie internazionali utilizzate nei modelli linguistici vocali, tra cui Mimi, DualCodec e CosyVoice2. Nelle valutazioni dedicate alla comprensione e alla generazione del parlato in coreano e in inglese, il tokenizzatore di Kakao ha registrato risultati superiori rispetto ai modelli che integrano queste soluzioni. Anche nelle prove condotte da valutatori esperti, chiamati ad ascoltare le tracce sintetizzate e a giudicare la naturalezza della voce e la somiglianza con il parlante di riferimento, il sistema ha ottenuto il punteggio più elevato.

Kakao sta lavorando a una struttura unificata capace di gestire all’interno dello stesso modello sia la comprensione sia la generazione della voce. L’obiettivo è evitare la separazione tradizionale tra riconoscimento vocale, interpretazione del contenuto e sintesi del parlato, facendo convergere queste funzioni in un’unica architettura in grado di analizzare e produrre direttamente segnali audio.

Le prossime evoluzioni riguarderanno anche gli elementi non verbali della comunicazione. Il modello dovrebbe imparare a generare in modo naturale risate, sospiri, esclamazioni e altre espressioni che accompagnano il linguaggio parlato ma non corrispondono a parole vere e proprie. Questi segnali consentirebbero di rendere la voce sintetica meno uniforme e di rappresentare con maggiore precisione intenzione, stato emotivo e contesto della conversazione.

Kakao prevede di integrare Kanana-o in diversi servizi per offrire interazioni vocali più naturali e facilmente controllabili. La possibilità di specificare con una sola istruzione il tono, il ritmo, l’emozione e l’accento può essere utilizzata nella lettura automatica di contenuti, negli assistenti vocali, nei sistemi conversazionali, nella produzione multimediale e nei servizi nei quali la stessa frase deve essere adattata a situazioni comunicative differenti.

Di Fantasy