Immagine AI

Kakao ha pubblicato su Hugging Face quattro nuovi small language model della famiglia Kanana-2, rendendoli disponibili come open source per l’esecuzione diretta su smartphone, personal computer e altri dispositivi locali. I modelli distribuiti sono Kanana-2-1.3B-base, Kanana-2-1.3B-instruct, Kanana-2-3B-base e Kanana-2-3B-instruct, con due diverse dimensioni da 1,3 e 3 miliardi di parametri e varianti base destinate allo sviluppo e all’ulteriore addestramento, affiancate da versioni instruct ottimizzate per seguire le richieste degli utenti e sostenere applicazioni conversazionali.

La distribuzione avviene attraverso la Kanana Open License, che consente anche l’utilizzo commerciale e permette di eseguire i modelli localmente senza vincoli specifici legati all’infrastruttura cloud di Kakao. L’azienda utilizza già i propri modelli leggeri all’interno di servizi come Kanana in KakaoTalk, le funzioni di sintesi delle conversazioni e delle chiamate di KakaoTalk e il progetto AI National Secretary, mostrando un orientamento verso applicazioni nelle quali una parte dell’elaborazione viene eseguita direttamente sul dispositivo o attraverso modelli compatti integrabili nei servizi esistenti.

Nonostante la riduzione delle dimensioni, Kakao dichiara che Kanana-2 raggiunge prestazioni superiori rispetto a modelli open source recenti della stessa classe sia in coreano sia in inglese. Le valutazioni comprendono conversazione, conoscenza generale, programmazione, matematica, rispetto delle istruzioni e chiamata di strumenti, aree nelle quali i nuovi modelli avrebbero ottenuto risultati comparabili a quelli di famiglie internazionali come Qwen e Gemma, pur mantenendo requisiti computazionali compatibili con ambienti on-device.

Una delle principali ottimizzazioni riguarda il tokenizer proprietario specializzato per la lingua coreana, sviluppato per rappresentare il testo con un numero inferiore di token rispetto alle soluzioni generaliste. Secondo Kakao, questa componente migliora di oltre il 30% l’efficienza nell’elaborazione del coreano, riducendo la quantità di token necessaria per codificare frasi e conversazioni e, di conseguenza, il carico di calcolo e memoria richiesto durante l’inferenza.

Kanana-2 adotta inoltre un’architettura di sliding window attention, nella quale ogni token non deve mantenere l’attenzione sull’intera sequenza precedente, ma opera prevalentemente all’interno di finestre mobili. Questa soluzione consente di gestire conversazioni con una lunghezza massima di 32K, pari a circa 32.000 token, riducendo fino al 72,7% l’utilizzo della memoria rispetto a un meccanismo di attenzione completa, un vantaggio particolarmente rilevante sui dispositivi dotati di quantità limitate di RAM o memoria condivisa.

La combinazione tra dimensioni contenute, tokenizer coreano dedicato e sliding window attention permette quindi di sostenere contesti relativamente lunghi senza trasferire necessariamente ogni richiesta verso un data center. Le varianti da 1,3 miliardi di parametri sono orientate agli ambienti con risorse più limitate, mentre i modelli da 3 miliardi offrono una maggiore capacità mantenendo comunque una scala inferiore rispetto ai grandi modelli linguistici utilizzati prevalentemente nel cloud.

Le versioni base consentono agli sviluppatori di intervenire sul modello attraverso fine-tuning e adattamenti specifici per dominio, mentre le versioni instruct sono già predisposte per comprendere comandi in linguaggio naturale, produrre risposte conversazionali e gestire funzioni come il tool calling. La presenza di tutte e quattro le configurazioni rende possibile scegliere tra maggiore flessibilità di addestramento e utilizzo immediato all’interno di assistenti, sistemi di riepilogo, applicazioni di produttività e agenti leggeri.

Noh Byeong-seok, responsabile dei risultati dello Unified Foundation Model di Kakao, ha spiegato che l’azienda considera contemporaneamente necessarie l’intelligenza artificiale cloud su larga scala e l’AI leggera eseguita sui dispositivi, soprattutto in vista della diffusione di sistemi agentici. Kakao prevede che la pubblicazione dei modelli possa sostenere la creazione di nuovi servizi e ampliare l’ecosistema nazionale dell’intelligenza artificiale, mettendo a disposizione degli sviluppatori modelli ottimizzati non soltanto per l’inglese, ma anche per l’elaborazione efficiente della lingua coreana.

Di Fantasy