Immagine AI

Liquid AI ha presentato il 7 ottobre 2026 due nuovi modelli di intelligenza artificiale a pesi aperti, denominati d1-3B e d1-omni-600M, sviluppati per eseguire attività decisionali su informazioni testuali, immagini e segnali audio con tempi di elaborazione particolarmente contenuti. I modelli appartengono alla famiglia d1 e sono stati progettati per applicazioni nelle quali un sistema deve valutare uno stato, attribuire una classificazione oppure scegliere tra differenti possibilità senza generare necessariamente una risposta linguistica articolata. La principale differenza rispetto ai tradizionali modelli generativi consiste infatti nella modalità di produzione del risultato: anziché generare progressivamente token attraverso una sequenza autoregressiva, i nuovi sistemi elaborano l’input mediante un’unica operazione di inferenza e restituiscono direttamente il punteggio o la decisione richiesta. Questa organizzazione riduce il tempo necessario a ottenere un risultato e permette di utilizzare i modelli all’interno di procedure che richiedono una risposta quasi immediata, come valutazione del comportamento degli agenti AI, classificazione di contenuti, controllo delle informazioni, analisi delle immagini e selezione dinamica dei modelli linguistici. d1-3B comprende circa 3,12 miliardi di parametri, mentre d1-omni-600M ne utilizza circa 587 milioni, offrendo due configurazioni che permettono di bilanciare accuratezza, memoria necessaria e capacità computazionale del dispositivo di destinazione. Entrambi sono disponibili attraverso Hugging Face e supportano l’esecuzione locale, il fine-tuning e la distribuzione in applicazioni sviluppate da terzi.

L’architettura dei due modelli deriva dalla famiglia Liquid Foundation Models, ma utilizza basi differenti in funzione delle caratteristiche richieste. d1-3B è stato costruito a partire da LFM2.5-VL-3B, un modello multimodale con architettura decoder-only, capace di analizzare congiuntamente informazioni testuali e immagini. Durante lo sviluppo, Liquid AI ha combinato i pesi di LFM2.5-2.6B con quelli del backbone testuale di LFM2.5-VL-3B, costruendo una base iniziale destinata al successivo addestramento per attività decisionali. Sono stati quindi utilizzati checkpoint ottenuti con inizializzazioni casuali differenti e diverse combinazioni di dati, successivamente riuniti mediante tecniche di fusione dei pesi. L’azienda ha rilevato che alcune modifiche apparentemente semplici al processo di addestramento, come l’impiego di input lunghi, la variazione dell’ordine delle possibili risposte e la correzione di scorciatoie statistiche presenti nei dataset, hanno prodotto miglioramenti particolarmente importanti. Queste procedure sono state utilizzate per evitare che il modello imparasse a riconoscere schemi superficiali delle domande anziché valutare effettivamente le informazioni contenute nell’input. La configurazione finale di d1-3B supporta finestre di contesto fino a 32.768 token e può ricevere testo e immagini, permettendo di formulare decisioni che richiedono informazioni più articolate rispetto a una semplice classificazione di poche parole.

d1-omni-600M adotta invece un’architettura basata su LFM2.5-Encoder-350M, un encoder bidirezionale che viene progressivamente ampliato con componenti dedicate alla visione artificiale e all’analisi audio. Il modello iniziale è stato sottoposto a fine-tuning su attività decisionali testuali, dopo il quale sono stati integrati due percorsi di elaborazione multimodale. Per l’audio, Liquid AI ha utilizzato un encoder FastConformer collegato al backbone attraverso un adattatore appositamente addestrato. Durante una delle fasi di sviluppo, l’encoder audio è stato ottimizzato mantenendo congelati i pesi del backbone testuale, così da adattare la rappresentazione dei segnali sonori senza modificare contemporaneamente tutte le componenti del sistema. Per la visione è stato invece impiegato un encoder derivato da LFM2.5-VL-450M, collegato mediante un adattatore e aggiornamenti LoRA applicati al backbone. Tali aggiornamenti venivano attivati soltanto quando l’input comprendeva immagini, mentre l’encoder visivo rimaneva congelato. Le successive fasi di addestramento hanno previsto il fine-tuning complessivo del modello, la fusione degli aggiornamenti LoRA e la media dei pesi con checkpoint precedenti per regolarizzare il comportamento finale. Il risultato è un sistema multimodale compatto capace di esaminare testo e immagini oppure testo e audio all’interno di una singola operazione decisionale. Liquid AI indica la possibilità di analizzare segmenti audio fino a trenta secondi, senza richiedere necessariamente la trascrizione completa prima della valutazione.

I risultati pubblicati per d1-3B mostrano prestazioni superiori a quelle di diversi modelli decisionali di dimensioni maggiori. Nel benchmark Decision Index versione 0.2.1, calcolato sulla porzione pubblica del dataset, il modello ha raggiunto un punteggio di 48,57, superando Decider 35B-A3B, che ha registrato 47,11 pur appartenendo a una categoria dimensionale considerevolmente superiore. Liquid AI descrive quindi d1-3B come il modello decisionale con il miglior risultato tra quelli inferiori a dieci miliardi di parametri nella valutazione considerata. Il confronto è significativo soprattutto perché riguarda modelli specializzati nello stesso tipo di attività, ma il punteggio deve essere interpretato nel contesto del benchmark utilizzato e non come una superiorità generalizzata rispetto a qualsiasi modello linguistico. Nei sette benchmark testuali pubblici utilizzati per valutare comprensione, classificazione e capacità di ragionamento, d1-3B ha ottenuto una media di 82,9 punti, superando gli 81,1 di Decider 4B. d1-omni-600M ha raggiunto invece una media di 78,4 punti, superiore ai 77,1 di Decider 2B, pur utilizzando un numero di parametri nettamente inferiore. Questi risultati evidenziano la possibilità di ottenere prestazioni competitive attraverso architetture specializzate e procedure di addestramento dedicate alla selezione delle risposte.

L’analisi dei singoli benchmark permette di individuare differenze più precise tra i due modelli. d1-3B ha raggiunto 85,3 punti in SQuAD 2.0, dedicato alla comprensione dei testi e alla risposta a domande, 87,3 in MASSIVE Intent per la classificazione delle intenzioni, 66,0 in PubMedQA per la valutazione di quesiti medici, 86,7 in BoolQ, 85,0 in XNLI e 76,9 in PAWS-X. Nel benchmark Civil Comments, dedicato al riconoscimento della tossicità dei contenuti, ha ottenuto 93,0 punti. Il modello più piccolo d1-omni-600M ha invece raggiunto 74,0 in SQuAD 2.0, 86,1 in MASSIVE Intent, 61,3 in PubMedQA, 77,7 in BoolQ e 74,7 in XNLI. Particolarmente rilevanti sono i risultati ottenuti in Civil Comments e PAWS-X, rispettivamente pari a 95,8 e 79,5, nei quali d1-omni-600M ha superato gli altri modelli presenti nella tabella comparativa. Queste differenze dimostrano che la configurazione più grande non è necessariamente superiore in ogni categoria: il modello da circa 600 milioni di parametri può risultare particolarmente efficace in attività circoscritte, come la classificazione dei contenuti potenzialmente offensivi e il riconoscimento di frasi semanticamente equivalenti. Liquid AI ha inoltre verificato il mantenimento delle capacità visive di d1-3B attraverso benchmark standard, mentre per d1-omni-600M ha presentato dimostrazioni multimodali senza pubblicare un punteggio audio comparabile a quelli testuali, precisando che la definizione di benchmark decisionali specifici per l’audio rimane un problema di ricerca aperto.

La velocità di inferenza costituisce uno degli elementi principali della nuova famiglia. Su una GPU NVIDIA GeForce RTX 4090, d1-3B è in grado di elaborare una domanda singola in circa 8 millisecondi, mentre su AMD MI325X il tempo rilevato è di 9 millisecondi. L’elaborazione di tre domande relative a uno stesso stato richiede rispettivamente 21 e 14 millisecondi, mentre un input testuale di circa 3.400 token viene elaborato in 102 millisecondi sulla GPU NVIDIA e in 44 millisecondi sul sistema AMD. Per immagini con risoluzione di 384 pixel, le latenze misurate sono di 17 millisecondi su RTX 4090 e 18 millisecondi su MI325X. Quando vengono elaborate 64 condizioni in modalità packed, il throughput raggiunge 475 stati al secondo sulla RTX 4090 e 1.106 sulla MI325X. Questi valori sono stati ottenuti in condizioni specifiche di benchmark e mostrano come la durata dell’inferenza vari in funzione della lunghezza dell’input, della quantità di informazioni da analizzare e della modalità di elaborazione. L’assenza di generazione autoregressiva permette tuttavia di misurare l’intero processo come una singola latenza dall’input al risultato, senza dover considerare una sequenza di token prodotti uno dopo l’altro.

Le verifiche sui dispositivi edge comprendono Apple M5 Pro e diverse configurazioni NVIDIA Jetson. Su Jetson AGX Thor, d1-3B ha completato una decisione singola in 16 millisecondi, mentre su Jetson AGX Orin con 64 GB di memoria ha richiesto 26 millisecondi e su Jetson Orin Nano circa 50 millisecondi. Apple M5 Pro ha registrato una latenza di 30 millisecondi. Per tre domande relative al medesimo stato, i valori sono risultati rispettivamente di 20, 35, 73 e 41 millisecondi. Quando la quantità di informazioni aumenta, anche il tempo necessario cresce: l’elaborazione di 3.400 token richiede 220 millisecondi su Jetson AGX Thor, 560 su AGX Orin, 1.640 su Orin Nano e 640 su Apple M5 Pro. I test relativi alle immagini da 384 pixel hanno registrato 35 millisecondi su AGX Thor, 83 su AGX Orin, 202 su Orin Nano e 62 su M5 Pro. In modalità packed, il throughput misurato varia da 262 stati al secondo sul dispositivo Thor a 38 su Orin Nano, mentre Apple M5 Pro raggiunge 78 stati al secondo. Liquid AI ha precisato che queste misurazioni riguardano d1-3B, mentre d1-omni-600M rimane una versione sperimentale ancora sottoposta a ulteriori sviluppi.

Le modalità decisionali supportate comprendono noul, choice e score, ciascuna destinata a una differente tipologia di risultato. Noul permette di ottenere una valutazione probabilistica binaria, utile quando il sistema deve distinguere tra due condizioni, come presenza o assenza di una violazione. Choice restituisce invece una distribuzione di probabilità tra più alternative, consentendo di selezionare una categoria, un modello oppure un’azione tra diverse possibilità. Score produce punteggi utilizzabili per valutare o ordinare elementi secondo criteri definiti. Queste modalità rendono la famiglia d1 utilizzabile come componente specializzato all’interno di infrastrutture agentiche più ampie. Un sistema di instradamento può impiegare d1-3B per scegliere quale modello linguistico utilizzare, mentre un motore di ricerca può utilizzare i punteggi per riordinare i risultati. Altre applicazioni comprendono valutazione automatica delle risposte tramite LLM-as-a-judge, controllo dei guardrail degli agenti, classificazione dei contenuti pericolosi e verifica multimodale di immagini o segnali vocali. L’elaborazione locale consente inoltre di utilizzare i modelli in situazioni nelle quali connettività, latenza o riservatezza dei dati rendono poco pratico il ricorso continuo a servizi cloud.

Entrambi i modelli vengono distribuiti con pesi aperti e supporto iniziale a llama.cpp, comprendendo ambienti hardware NVIDIA, AMD, Apple e Qualcomm. I pesi possono essere scaricati da Hugging Face, modificati attraverso fine-tuning e integrati in sistemi distribuiti localmente, nel rispetto delle condizioni previste dalla licenza LFM Open License. Per le imprese con fatturato annuo inferiore a dieci milioni di dollari, Liquid AI consente l’utilizzo commerciale gratuito secondo i termini della licenza. Le organizzazioni che superano tale soglia devono verificare le condizioni applicabili prima di impiegare i modelli commercialmente. La disponibilità di due architetture differenti permette agli sviluppatori di scegliere tra un sistema più grande, destinato a decisioni testuali e visive con maggiore capacità, e un modello estremamente compatto che aggiunge anche l’elaborazione audio. Liquid AI presenta d1-3B come componente già valutato su differenti piattaforme hardware e d1-omni-600M come checkpoint sperimentale, destinato a ulteriori miglioramenti soprattutto nelle capacità multimodali. La famiglia d1 introduce così modelli specializzati nella produzione immediata di decisioni, utilizzabili autonomamente oppure come componenti di controllo e valutazione all’interno di sistemi di intelligenza artificiale più complessi.

Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)

Di Fantasy