Immagine AI

Krafton ha pubblicato su Hugging Face A.X K2 Raon-Speech, un modello fondazionale di intelligenza artificiale vocale con 21 miliardi di parametri, progettato per comprendere il parlato e generare risposte vocali naturali. Il sistema è stato sviluppato partendo da A.X K2, il modello principale utilizzato dal gruppo guidato da SK Telecom nella seconda valutazione del progetto nazionale sudcoreano dedicato alla realizzazione di modelli fondazionali di intelligenza artificiale indipendenti.

Krafton partecipa al gruppo di lavoro selezionato da SK Telecom nell’ambito dell’iniziativa promossa dal Ministero sudcoreano della Scienza e delle Tecnologie dell’informazione e della comunicazione, concentrandosi sulla ricerca relativa ai modelli multimodali. Nell’aprile 2026 la società aveva inoltre presentato il marchio di modelli AI Raon e pubblicato come open source quattro sistemi: il modello linguistico vocale Raon-Speech, il modello per conversazioni vocali in tempo reale Raon-SpeechChat, il sistema di conversione da testo a voce Raon-OpenTTS e il codificatore visivo Raon-VisionEncoder.

A.X K2 Raon-Speech utilizza il modello linguistico di dimensioni contenute basato su A.X K2, al quale Krafton ha integrato un codificatore vocale e un codec audio addestrati internamente. Il processo di sviluppo riprende il metodo impiegato per il precedente Raon-Speech, ma lo applica alla base linguistica di SK Telecom per collegare le capacità testuali del modello con la comprensione e la produzione del parlato. Il codificatore trasforma la voce umana in informazioni elaborabili dall’intelligenza artificiale, mentre il codec converte i contenuti generati dal modello in una voce naturale.

Krafton ha sviluppato una procedura di addestramento che consente di collegare in modo stabile gli ingressi e le uscite vocali senza ridurre le competenze testuali originarie del modello linguistico. A.X K2 Raon-Speech è quindi in grado di ricevere una richiesta pronunciata, interpretarne il contenuto e produrre direttamente una risposta vocale, mantenendo le capacità di elaborazione testuale e di utilizzo degli strumenti disponibili nel modello di partenza.

Il sistema è stato progettato per conservare anche le informazioni non strettamente lessicali presenti nella voce dell’utente. Il modello può rilevare elementi come emozioni, intonazione e altri indizi acustici, utilizzandoli per generare risposte vocali più coerenti con il modo in cui la richiesta è stata pronunciata. L’obiettivo è evitare che il passaggio dalla voce alla rappresentazione interna del modello elimini caratteristiche rilevanti del parlato, come avviene più facilmente nei sistemi costruiti attraverso una semplice successione di riconoscimento vocale, elaborazione testuale e sintesi della voce.

Nelle valutazioni condotte da Krafton, A.X K2 Raon-Speech ha ottenuto il primo posto per prestazioni complessive in lingua coreana e il terzo posto in inglese tra i modelli linguistici vocali aperti con meno di 30 miliardi di parametri. Il confronto ha interessato sei aree: riconoscimento vocale, sintesi vocale, comprensione del parlato, risposta a domande formulate vocalmente, risposta a domande testuali e chiamata di strumenti o funzioni esterne.

La valutazione è stata effettuata attraverso 46 benchmark, dei quali 24 dedicati alla lingua coreana e 22 all’inglese. Tra i set di prova utilizzati figurano LibriSpeech e KSponSpeech per il riconoscimento del parlato, VoiceBench e KVoiceBench per la valutazione delle capacità vocali, MMAU e KMMAU per la comprensione audio, oltre ad API-Bank e FunctionChat-Bench per verificare la capacità del modello di richiamare strumenti e funzioni sulla base delle richieste ricevute.

Le competenze sviluppate con A.X K2 Raon-Speech saranno utilizzate anche per migliorare i CPC, acronimo di Co-Playable Character, personaggi controllati dall’intelligenza artificiale capaci di giocare insieme agli utenti. Krafton intende impiegare la comprensione della voce, dell’intonazione e delle emozioni per rendere più naturali le interazioni con questi personaggi, consentendo loro di interpretare le richieste pronunciate dai giocatori e rispondere vocalmente durante la partita.

La società continuerà parallelamente a sviluppare tecnologie fondazionali di intelligenza artificiale destinate ai videogiochi, insieme alle attività di ricerca sui world model e sull’intelligenza artificiale fisica. Nel primo semestre del 2026 Krafton ha registrato ricavi per 2.661,6 miliardi di won e un utile operativo di 972,5 miliardi, raggiungendo in entrambi i casi il valore semestrale più alto della propria storia. Rispetto allo stesso periodo del 2025, i ricavi sono aumentati del 73,3% e l’utile operativo del 38,3%, mentre il solo risultato operativo dei primi sei mesi ha raggiunto il 92% dell’utile realizzato nell’intero esercizio precedente.

Di Fantasy