Immagine AI

AIWORKX ha sviluppato e testato in Cambogia un chatbot di intelligenza artificiale destinato ai servizi pubblici, progettato per consentire ai cittadini di ottenere in lingua khmer informazioni sulle procedure amministrative e sui documenti necessari. Il sistema utilizza i documenti pubblici locali come base di conoscenza attraverso un’architettura RAG, Retrieval-Augmented Generation, ed è stato realizzato nell’ambito di una sperimentazione condotta su un servizio di assistenza ai cittadini di un ente pubblico nazionale cambogiano. Il progetto è nato per verificare sia le capacità di comprensione del khmer da parte del modello linguistico sia la possibilità di utilizzare efficacemente un sistema RAG in un contesto caratterizzato da una quantità particolarmente limitata di dati linguistici. La realizzazione del servizio vero e proprio è prevista in maniera progressiva a partire dal 2026.

Il khmer rientra infatti tra le cosiddette Low-Resource Languages, lingue per le quali sono disponibili quantità ridotte di corpus, documenti digitalizzati e altri dati utilizzabili per addestrare e perfezionare i modelli di intelligenza artificiale. La sua struttura introduce inoltre difficoltà specifiche per i sistemi NLP, perché la scrittura presenta sequenze di caratteri senza una separazione delle parole analoga a quella utilizzata in molte lingue occidentali e segue regole ortografiche complesse. Secondo una revisione delle ricerche pubblicata nel 2025, l’intera quantità di dati di addestramento in khmer utilizzata nei modelli linguistici generativi documentati dalla comunità scientifica internazionale si colloca complessivamente tra circa 70.000 e 579.000 frasi. Per confronto, Llama 3.1, scelto come modello di partenza per la sperimentazione, è stato preaddestrato su un corpus multilingue equivalente a circa 15.000 miliardi di token: i dati disponibili specificamente per il khmer rappresentano quindi una frazione estremamente ridotta delle risorse normalmente impiegate per un grande modello linguistico.

Per affrontare questo limite, AIWORKX ha lavorato separatamente sui livelli del modello, della ricerca delle informazioni e dei dati. Come base è stato utilizzato Llama 3.1 8B, modello open-weight di Meta, sottoposto a ulteriore addestramento e instruction tuning con circa 200.000 frasi in khmer provenienti da un corpus della National Information Society Agency sudcoreana, NIA. La quantità utilizzata è dello stesso ordine di grandezza dell’intero patrimonio di dati khmer per modelli generativi riportato finora nelle pubblicazioni scientifiche internazionali. Parallelamente sono stati confrontati nove differenti modelli di embedding multilingue per individuare quello capace di restituire la maggiore precisione nella ricerca semantica dei documenti in khmer.

Per costruire il livello RAG sono stati quindi raccolti documenti pubblici cambogiani, successivamente ripuliti, standardizzati e trasformati in una base di conoscenza interrogabile dal sistema. La qualità delle risposte è stata verificata utilizzando diverse centinaia di domande costruite per riprodurre richieste amministrative realistiche. Il processo di acquisizione, elaborazione e gestione documentale è stato standardizzato attraverso AIWORKX Document Framework, la piattaforma dell’azienda dedicata al trattamento dei documenti. Il chatbot può così recuperare dai documenti istituzionali le informazioni pertinenti alla domanda e utilizzarle come contesto per generare la risposta, anziché affidarsi esclusivamente alle informazioni apprese dal modello durante il preaddestramento.

Una parte centrale dell’architettura riguarda la tracciabilità delle risposte. Ogni risultato può riportare la fonte originale e il relativo collegamento, mentre sul lato gestionale sono stati implementati controllo degli accessi basato sui ruoli, RBAC, registri di audit e versionamento degli indici della base di conoscenza. Il sistema adotta inoltre un comportamento conservativo quando le informazioni recuperate non forniscono elementi sufficienti per formulare una risposta certa, evitando di presentare come fatti conclusioni non adeguatamente sostenute dalle fonti disponibili. Queste caratteristiche sono state introdotte per ridurre allucinazioni e inferenze prive di fondamento e permettere di ricostruire successivamente quali informazioni siano state utilizzate dall’AI per produrre una determinata risposta, requisito particolarmente importante quando il sistema viene impiegato nell’erogazione di servizi pubblici. L’impostazione è collegata anche alla tecnologia AxDC, Controllable LLM, sviluppata da AIWORKX per far funzionare i modelli entro domini, reti e perimetri operativi definiti.

I test preliminari hanno mostrato un miglioramento delle prestazioni del modello dopo l’addestramento supplementare sul khmer nei benchmark strutturati secondo il formato MMLU. Anche nella valutazione delle risposte alle richieste amministrative, effettuata attraverso un sistema LLM-as-a-Judge, l’architettura proposta ha ottenuto il risultato migliore tra le configurazioni messe a confronto. La sperimentazione indica quindi la possibilità di migliorare un modello destinato a una lingua con disponibilità molto limitata di dati combinando fine-tuning mirato, selezione dell’embedding, recupero delle informazioni da documenti controllati e meccanismi di verifica della provenienza delle risposte, anziché tentare di costruire un grande modello linguistico esclusivamente attraverso enormi quantità di nuovi dati.

Il progetto è collegato al programma “Cambodia Phnom Penh AI Ecosystem Development and Digital Job Creation Project”, sostenuto dalla Korea International Cooperation Agency attraverso il programma IBS, Inclusive Business Solution. L’iniziativa si svolge dal 2026 al 2030 e prevede la costruzione di dataset AI in lingua khmer, la formazione di giovani e persone appartenenti a categorie interessate dal divario digitale, la preparazione di formatori locali e il collegamento tra formazione, esperienza pratica, occupazione e sviluppo di servizi. AIWORKX prevede di costruire durante il programma almeno 5 milioni di frasi per l’addestramento dell’AI in khmer, formare 450 persone e preparare almeno 50 formatori locali, affiancando a queste attività sperimentazioni di servizi AI nei settori pubblico e privato.

La roadmap tecnologica prevede un ampliamento progressivo basato su quattro componenti, dati, tecnologie linguistiche, modelli e infrastruttura. Il sistema dovrebbe passare inizialmente dall’applicazione a uno specifico ambito amministrativo al coinvolgimento di più ministeri, con la prospettiva di arrivare successivamente a servizi su scala nazionale. Una distribuzione estesa non è tuttavia ancora prevista sulla base della sola sperimentazione iniziale e richiederà ulteriori attività di verifica prima dell’utilizzo su larga scala.

Il lavoro tecnico è stato raccolto nello studio “Traceable LLM-RAG for Responsible AI-Enabled Public Services in Low-Resource Language Contexts: A Khmer Case Study”, selezionato nel luglio 2026 attraverso double-blind review per ICEGOV 2026, la 19ª International Conference on Theory and Practice of Electronic Governance organizzata da UNU-EGOV, unità operativa dell’Università delle Nazioni Unite. I risultati saranno presentati dal 28 settembre al 1° ottobre 2026 a Riyadh, in Arabia Saudita, durante la conferenza organizzata insieme alla Prince Sultan University e sostenuta dalla Digital Government Authority saudita, dedicata al rafforzamento della governance digitale attraverso servizi innovativi, human-centered e affidabili.

Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)

Di Fantasy