Immagine AI

Allen Institute for AI (Ai2) ha reso open source AstaBrief 8B, un modello progettato specificamente per trasformare una domanda di ricerca e gli estratti della letteratura scientifica recuperati dal sistema in un report strutturato corredato di citazioni. Il modello è stato integrato nella piattaforma scientifica agentica Asta come modalità Fast della funzione Generate a report, affiancando la modalità Thinking basata su Claude. L’obiettivo è ottenere una qualità comparabile a quella raggiunta con modelli proprietari riducendo però tempi di elaborazione e costi di inferenza: considerando l’intera pipeline di Asta, Fast genera mediamente un report in 51,1 secondi contro i 178,5 secondi della modalità Thinking, risultando circa 3,5 volte più veloce. AstaBrief 8B deriva da Qwen3-8B, viene distribuito con licenza Apache 2.0 insieme ai pesi e ai dati di addestramento e può essere eseguito su infrastrutture private, anche dietro firewall aziendali o accademici, una possibilità particolarmente importante quando l’analisi riguarda ricerche sensibili o non ancora pubblicate. Ai2 ha inoltre pubblicato nel repository ai2-scholarqa-lib un workflow adattabile per generare report direttamente da raccolte proprie di PDF.

Il modello è stato ottenuto attraverso supervised fine-tuning seguito da Direct Preference Optimization, evitando un addestramento basato sul reinforcement learning che, pur avendo prodotto buoni risultati nel precedente lavoro DR Tulu, avrebbe comportato maggiore costo e instabilità. AstaBrief è stato inoltre addestrato a generare l’intero report in un singolo passaggio partendo dalla query e dagli snippet recuperati, eliminando sia le fasi intermedie di sintesi e clustering utilizzate dalla modalità Thinking sia la composizione progressiva sezione per sezione. Il dataset iniziale deriva da query reali inviate al sistema ScholarQA: dopo aver escluso traffico di bot e beta tester, richieste troppo brevi, contenuti non scientifici o non in inglese e prompt contenenti informazioni personali, sono rimaste circa 90.000 query. Per il supervised fine-tuning sono stati prodotti report completi tramite una combinazione di Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini e GPT-4.1, ridotti dopo i controlli di qualità a circa 47.000 esempi. La fase DPO ha utilizzato invece coppie di report generate dalla pipeline ScholarQA e da modelli come o3, o4-mini, DeepSeek-V3 e DeepSeek-R1, valutate da GPT-4.1 e DeepSeek-R1; sono state conservate soltanto le preferenze sulle quali entrambi i giudici concordavano, ottenendo circa 6.000 esempi finali. Ai2 segnala che l’intervento più efficace è stato soprattutto l’eliminazione dei report caratterizzati da una bassa densità di citazioni, mentre filtraggi più aggressivi e variazioni del learning rate non hanno prodotto miglioramenti rilevanti.

Sul test ScholarQA-CS2, AstaBrief 8B ha raggiunto una media di 87 nei parametri considerati, contro 83,7 del checkpoint ottenuto con il solo supervised fine-tuning e 77,3 del Qwen3-8B originale. Più nel dettaglio, il modello ha ottenuto 90,2 nell’ingredient recall, 89 nella precisione delle risposte, 90,5 nella precisione delle citazioni e 78,2 nel citation recall. Il DPO ha quindi colmato una parte consistente del divario che i primi checkpoint mostravano rispetto alla pipeline basata su Claude soprattutto nella precisione delle risposte e nella qualità delle citazioni, anche se AstaBrief non domina tutte le valutazioni disponibili e rimane dietro alla pipeline Claude in alcuni benchmark come DeepScholarBench. Nei primi test effettuati dagli utenti di Asta, su 374 persone che hanno provato Fast il 29,1% l’ha utilizzata in almeno due giorni differenti, il 23% non è più tornato alla modalità Thinking e un ulteriore 18% ha alternato i due sistemi in funzione del compito; il feedback positivo è stato dell’84,2% per Fast contro l’85,2% per Thinking, valori molto vicini anche se il numero di valutazioni raccolte è ancora insufficiente per conclusioni definitive.

Ai2 sta già valutando ulteriori evoluzioni, tra cui tecniche più raffinate di preference learning, sistemi che combinano retrieval augmented generation e reinforcement learning, capacità multi-turno e multi-tool, nuove fonti di dati scientifici e meccanismi di decomposizione delle query. Un altro fronte riguarda la valutazione della fedeltà alle fonti, verificando non soltanto la presenza delle citazioni ma anche che il modello non estenda le conclusioni oltre ciò che gli studi citati consentono effettivamente di sostenere. AstaBrief si inserisce così nella linea di ricerca sviluppata da Ai2 attraverso ScholarQA e DR Tulu e nel più ampio lavoro sui modelli aperti destinati alla ricerca scientifica, che comprende anche NSF OMAI e le future evoluzioni della famiglia Olmo.

Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)

Di Fantasy