Ricercatori di Stanford e Nvidia hanno sviluppato Contrastive Language Models, o CLM, un nuovo approccio destinato a compiti nei quali un agente AI deve scegliere tra un insieme definito di azioni, strumenti o risultati invece di generare liberamente una sequenza di testo. Il modello rilasciato, CLM-8B, utilizza un backbone Qwen3-8B congelato e due componenti separate dedicate rispettivamente alla rappresentazione dello stato corrente e delle azioni disponibili. Invece di inserire ogni volta tutte le alternative in un prompt e generare autoregressivamente il nome dell’azione selezionata, CLM costruisce rappresentazioni vettoriali dello stato e delle possibili azioni all’interno di uno spazio condiviso, quindi sceglie l’opzione la cui rappresentazione risulta più vicina a quella dello stato. Questo design permette soprattutto di pre-calcolare e memorizzare nella cache le rappresentazioni delle azioni che vengono riutilizzate frequentemente: se, per esempio, un agente IT aziendale dispone sempre delle stesse 50 operazioni autorizzate, come reimpostare una password, creare un ticket, assegnare un’autorizzazione oppure effettuare un’escalation verso il team di sicurezza, queste azioni possono essere codificate una sola volta e successivamente confrontate con ogni nuovo stato senza dover essere nuovamente processate. Nei test zero-shot condotti su attività di computer use, gaming e tool calling, CLM-8B ha raggiunto velocità fino a nove volte superiori rispetto a Jev di TypeSafe; ha eguagliato il tasso di successo di Jev in due benchmark relativi ai giochi, mentre negli altri due test ha mostrato una precisione inferiore, ottenendo il 95,2% contro il 99,2% di Jev nel benchmark BFCL v4 dedicato al tool calling e completando 26 delle 30 attività WikiRacing contro le 30 completate da Jev. I maggiori vantaggi prestazionali sono emersi proprio nei casi nei quali le stesse azioni potevano essere riutilizzate in più stati oppure quando il sistema doveva selezionare una risposta tra un insieme particolarmente ampio di candidati.
L’addestramento utilizza un obiettivo contrastivo basato su InfoNCE, una tecnica nella quale al modello viene presentata una coppia corretta stato-azione insieme a diverse coppie errate e il sistema viene ottimizzato affinché assegni la massima similarità alla combinazione corretta, avvicinandone le rappresentazioni e allontanando contemporaneamente quelle delle alternative non pertinenti. Il training di CLM è stato organizzato in tre fasi: inizialmente sono state utilizzate circa 60 milioni di coppie domanda-risposta per costruire una capacità generale di corrispondenza semantica; successivamente sono stati aggiunti circa 30 milioni di “hard negatives” sintetici, cioè esempi nei quali le possibili risposte sono semanticamente simili tra loro ma soltanto una è corretta; infine il modello è stato sottoposto a post-training utilizzando circa un milione di traiettorie agentiche, così da adattarlo ai problemi di decisione che si verificano durante l’esecuzione concreta di workflow AI. La separazione tra encoder dello stato ed encoder dell’azione costituisce uno degli elementi architetturali più rilevanti del progetto perché consente di elaborare i due componenti indipendentemente, memorizzare le azioni e calcolare a ogni richiesta soltanto la rappresentazione dello stato che cambia. CLM-8B supporta diversi formati di decisione limitata: può scegliere tra opzioni predefinite, restituire una probabilità relativa a una risposta binaria sì/no, assegnare un punteggio lungo una scala ordinata oppure classificare un insieme arbitrario di candidati. Questo rende il modello utilizzabile, per esempio, nel routing verso strumenti o API, nella classificazione dei ticket di assistenza, nella selezione preliminare dei risultati di retrieval, nella scelta fra più output prodotti da altri modelli e in generale in tutti i casi nei quali il problema non richiede di generare liberamente una nuova risposta ma di decidere quale delle opzioni già disponibili sia più adatta alla situazione corrente.
La differenza rispetto a un normale modello generativo riguarda anche il costo computazionale delle decisioni all’interno di sistemi agentici complessi. Le API moderne di function calling e structured output permettono già a un grande modello linguistico di scegliere in maniera affidabile tra un insieme limitato di strumenti, ma il modello deve comunque elaborare l’intero prompt e generare autoregressivamente una risposta anche quando il risultato finale consiste soltanto nel nome di una funzione. CLM affronta invece direttamente il problema come un’attività di matching e ranking, eliminando la generazione token per token dell’output. I ricercatori non hanno pubblicato un confronto economico diretto e omogeneo con le API dei principali modelli frontier, quindi i risultati non permettono di quantificare un preciso risparmio in termini di costi di hosting o inferenza; CLM-8B rimane inoltre un encoder da otto miliardi di parametri. Il vantaggio principale emerge però quando un agente deve effettuare molte decisioni successive: una singola operazione di routing può rappresentare una frazione trascurabile della latenza complessiva, ma un agente che durante lo stesso lavoro seleziona strumenti, classifica risultati, verifica condizioni e valuta decine di passaggi può accumulare rapidamente il costo di tutte queste generazioni. Anche l’adattamento a domini specifici richiede meno parametri da addestrare rispetto al fine-tuning dell’intero modello, perché il backbone Qwen3-8B rimane congelato e vengono modificati soltanto i projection head relativi a stati e azioni. Secondo Jacky Kwok di Stanford, responsabile del progetto, l’obiettivo contrastivo si è inoltre mostrato particolarmente efficace nei compiti di decisione rispetto al normale supervised fine-tuning con cross-entropy e l’utilizzo di un checkpoint CLM pre-addestrato consente di adattare rapidamente il modello a compiti o domini specifici.
Questa impostazione è stata testata anche utilizzando CLM come verificatore di soluzioni di programmazione generate da modelli più grandi. Nei benchmark dedicati al codice, CLM non ha prodotto autonomamente le soluzioni ma ha ricevuto più candidati generati in precedenza da altri modelli e ha selezionato quello da sottoporre come risposta finale: Opus 5 ha prodotto le soluzioni candidate per DeepSWE, mentre Fable 5 è stato utilizzato per Terminal-Bench 2.1. Su sottoinsiemi mantenuti separati dai dati di addestramento, CLM ha raggiunto l’81,6% su 38 task DeepSWE e l’87,6% su 30 task Terminal-Bench 2.1, mentre Jev ha ottenuto rispettivamente il 71,1% e l’83,1% sugli stessi sottoinsiemi; la latenza del verificatore CLM è risultata inoltre tra 4,1 e 5,7 volte inferiore rispetto a quella di Jev. Il risultato deve però essere interpretato nel contesto corretto: CLM non ha risolto direttamente i problemi di programmazione, ma ha agito come livello di selezione sopra output già prodotti da modelli generativi più potenti. Questo definisce anche il ruolo che i ricercatori immaginano per questo tipo di architettura nei sistemi multi-modello: i grandi reasoning model possono essere utilizzati per generare, pianificare e costruire soluzioni, mentre modelli contrastivi più economici possono selezionare, verificare e monitorare gli output. Una possibile architettura potrebbe quindi utilizzare diversi modelli open source relativamente economici per produrre candidati e affidare poi a un CLM il ranking finale. Lo stesso principio potrebbe essere applicato al monitoraggio di agenti di lunga durata: nei test il team ha osservato una separazione abbastanza netta tra i punteggi CLM relativi a traiettorie riuscite e quelli delle traiettorie fallite, suggerendo la possibilità di utilizzare il modello per segnalare comportamenti anomali o azioni che sembrano portare l’agente fuori dal percorso previsto, anche se questo tipo di punteggio non costituisce di per sé un meccanismo di sicurezza garantito.
Il funzionamento come verificatore presenta infatti un limite strutturale importante: CLM può soltanto ordinare le alternative che riceve e le probabilità prodotte sono relative all’insieme di candidati disponibile. Se tutte le azioni proposte sono sbagliate, il sistema dovrà comunque assegnare loro un ordine e indicarne una come migliore rispetto alle altre. Per lo stesso motivo CLM non è pensato per sostituire un modello general purpose nei compiti che richiedono ragionamento aperto, pianificazione complessa, risoluzione autonoma di problemi matematici o produzione di testi lunghi. Il suo spazio di utilizzo è costituito soprattutto da situazioni nelle quali l’insieme delle possibilità è già conosciuto e il modello deve selezionare, classificare o verificare una delle opzioni disponibili. L’approccio si inserisce in una categoria emergente di modelli per decisioni rapide che TypeSafe definisce “System One”: Jev, presentato il 15 settembre 2026, utilizza una tecnica chiamata Reinforcement Learning for Calibrated Decisions, Laya adotta piccoli encoder bidirezionali e CUA-S1 è focalizzato in maniera più specifica sulla selezione di azioni limitate nei task di compilazione di moduli. Una delle differenze dichiarate tra CLM e modelli come Jev o Laya riguarda proprio il caching: secondo Kwok, Jev e Laya permettono principalmente di memorizzare la rappresentazione dello stato, mentre l’architettura dual-encoder di CLM consente di calcolare e memorizzare indipendentemente sia stati sia azioni. La caratteristica diventa particolarmente utile quando contesto e azioni sono lunghi o quando un insieme fisso di strumenti, API o workflow aziendali deve essere riutilizzato attraverso un elevato numero di richieste.
Il progetto è stato distribuito come software aperto. I pesi di CLM-8B sono disponibili con licenza Apache 2.0 insieme al codice sorgente, a un’API compatibile con l’interfaccia di TypeSafe, agli strumenti per il fine-tuning e a un playground che consente di inserire uno stato, aggiungere domande strutturate e visualizzare le relative distribuzioni di probabilità oppure classificare direttamente gruppi arbitrari di candidati. Il server clm-serve include anche un’interfaccia Web e può essere eseguito, secondo l’esempio fornito dal progetto, utilizzando Qwen3-8B come encoder su una singola GPU RTX 4090. CLM-8B rappresenta inoltre soltanto uno dei punti della scala dimensionale che il gruppo sta utilizzando per studiare il comportamento del modello al crescere di dati e parametri: il team sta addestrando CLM-35B-A3B, una versione multimodale di dimensioni maggiori che dovrebbe essere pubblicata all’inizio di ottobre 2026 e che utilizza più dati e capacità computazionale. Parallelamente è in corso un post-training con una quantità significativamente superiore di dati agentici, con l’obiettivo di rendere questi modelli più facilmente integrabili negli harness e nei workflow già utilizzati per costruire agenti.
Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)
