Immagine AI

Liquid AI ha presentato d1, un modello progettato non per generare testo, ma per calcolare direttamente la probabilità associata a un insieme di opzioni predefinite. A differenza dei normali LLM, che producono una risposta token dopo token, d1 elabora in una singola richiesta la probabilità relativa delle alternative disponibili e non genera token di output, evitando quindi anche il processo di decoding. Il modello è pensato per attività ripetitive nelle quali occorre scegliere, classificare o assegnare una priorità secondo criteri già definiti, come smistamento delle richieste dei clienti, routing dei ticket, moderazione dei contenuti, selezione del modello da utilizzare, valutazione delle priorità e stima di rischio o urgenza. Può quindi sostituire quei flussi nei quali un LLM tradizionale viene istruito a restituire una determinata etichetta o un numero, spesso in formato JSON, pur non essendo necessaria una vera generazione linguistica.

d1 supporta tre modalità di interrogazione che possono essere combinate nella stessa richiesta. Noul esegue valutazioni binarie e restituisce una probabilità compresa tra 0 e 1, per esempio per stabilire quanto sia probabile che un messaggio rappresenti un reclamo. Choice sceglie invece tra più alternative, come l’instradamento di una richiesta verso fatturazione, assistenza tecnica o servizio clienti, fornendo non soltanto l’opzione più probabile ma anche le probabilità associate alle altre possibilità, così da individuare i casi ambigui. Score è destinato alle valutazioni su scala, per esempio il livello di urgenza di un incidente compreso tra 0 e 3, e può restituire valori continui come 2,9995 anziché limitarsi agli interi. Le tre modalità possono essere utilizzate contemporaneamente, consentendo per esempio di classificare il tipo di richiesta, calcolarne l’urgenza e stimare la probabilità che si tratti di una segnalazione di bug all’interno di una singola chiamata.

Liquid AI dichiara inoltre che d1 ha superato Jev, precedente modello al vertice dell’Hugging Face Decision Index, una valutazione composta da 37 benchmark suddivisi tra comprensione linguistica, retrieval e classificazione, strumenti e automazione, conoscenza e ragionamento e giudizio artistico e umano. Secondo l’azienda, il modello mostra miglioramenti anche nelle valutazioni multilingue, nella gestione di input lunghi e nella resistenza agli attacchi di prompt injection. I risultati di benchmark non vengono però considerati sufficienti per determinare automaticamente l’affidabilità in produzione: Liquid AI sottolinea che calibrazione delle probabilità e accuratezza devono essere verificate sui dati reali di ciascuna organizzazione e che, nelle decisioni ad alto impatto, i casi caratterizzati da maggiore incertezza dovrebbero essere trasferiti a una persona oppure a un altro modello.

Per mostrare il funzionamento del sistema è stato pubblicato anche un semplice gioco di corse in pixel art nel quale d1 deve scegliere continuamente tra corsia sinistra, centrale e destra in base allo stato corrente, effettuando tra due e cinque decisioni al secondo. Il modello è già disponibile gratuitamente attraverso la Liquid AI API con il nome d1:free e accetta informazioni sullo stato sotto forma di testo o JSON insieme alle domande da valutare. L’azienda prevede inoltre di pubblicarne i pesi in formato open weight e di renderlo disponibile tramite OpenRouter. d1 non viene proposto come sostituto dei modelli generativi tradizionali, che rimangono più adatti per scrittura, riassunti, programmazione, conversazione e ragionamento complesso, ma come modello specializzato per scenari nei quali le alternative sono già note e il problema principale consiste nell’eseguire rapidamente e ripetutamente una scelta probabilistica.

Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)

Di Fantasy