Immagine AI

H Company ha rilasciato Holo4, una nuova famiglia di modelli agentici progettati per utilizzare direttamente computer, applicazioni e servizi digitali attraverso interfacce differenti. La serie comprende Holo4-27B, modello dense da 27 miliardi di parametri, e Holo4-35B-A3B, architettura Mixture of Experts da 35 miliardi di parametri complessivi e circa 3 miliardi attivi. I pesi sono disponibili su Hugging Face, mentre entrambi i modelli possono essere utilizzati anche tramite H Models API. Holo4 può interagire con un ambiente attraverso interfacce grafiche, codice, server MCP e API: può quindi fare clic e digitare sullo schermo, scrivere ed eseguire autonomamente codice oppure richiamare strumenti MCP e API, scegliendo il metodo adatto al compito. Lo stesso modello può essere utilizzato su desktop, Web, Android, all’interno di sandbox per l’esecuzione di codice e con API aziendali, senza dover selezionare una variante diversa a seconda della piattaforma. I pesi vengono distribuiti nei formati BF16, FP8, NVFP4 e GGUF a 4 bit. Holo4-27B è un vision-language model basato sull’architettura dense Qwen3.8 e dispone di una finestra di contesto massima di 262.144 token, con ambienti di destinazione che comprendono Web, desktop e dispositivi mobili. Il modello può essere utilizzato attraverso hai-agents, l’harness sviluppato da H Company che invia al modello screenshot e risultati degli strumenti e successivamente esegue le azioni richieste, come clic, digitazione, esecuzione di codice e chiamate a tool. I pesi di Holo4-27B sono pubblicati con licenza CC BY-NC 4.0 per uso non commerciale e il modello viene indicato come destinato alla ricerca; Holo4-35B-A3B viene invece distribuito con licenza Apache 2.0. Tramite API, il modello MoE costa 0,30 dollari per milione di token in input, 0,03 dollari per milione di token presenti nella cache e 2 dollari per milione di token in output. Per Holo4-27B i prezzi sono rispettivamente 0,40, 0,04 e 3 dollari per milione di token, con contesto da 262K per entrambi.

Nei test OSWorld, dedicati all’utilizzo di ambienti informatici attraverso interfacce grafiche, Holo4-27B raggiunge un punteggio dell’85,2% con un costo dichiarato di 0,08 dollari per task, mentre Holo4-35B-A3B raggiunge l’80,8% a 0,05 dollari per task. Il modello base Qwen3.8 27B ottiene nello stesso confronto l’84,3% con un costo di 0,22 dollari per task. Nella tabella sono riportati anche l’86,0% di Fable 5, il 78,7% di GPT-5.5 e l’86,1% di Qwen3.8 Max. Nei workflow più lunghi di OSWorld 2.0, Holo4-27B ottiene invece un punteggio del 61,7%, con un success rate del 41,5% e un costo di 1,22 dollari per task; Holo4-35B-A3B raggiunge il 30,9% a 0,61 dollari per task. Nello stesso benchmark vengono indicati l’81,8% di Opus 5.5 a 8,48 dollari per task, il 73,5% di GPT-6 Astra a 9,07 dollari e il 48,0% di Qwen3.8 27B a 3,49 dollari. Su AutomationBench, benchmark rivolto all’automazione di attività aziendali, Holo4-27B raggiunge il 45,4% con un costo di 0,05 dollari per task, mentre Holo4-35B-A3B arriva al 34,5% a 0,02 dollari. In questo caso è necessario considerare anche la composizione del dataset: 480 dei 600 task presenti nel set pubblico v1.0.6 appartengono allo stesso split dal quale sono stati raccolti dati utilizzati durante l’addestramento. Sui 120 task mantenuti separati, Holo4-27B registra il 49,3% e il modello MoE il 31,7%. H Company prevede inoltre di pubblicare i risultati sul set privato quando Holo4 verrà valutato attraverso il benchmark ufficiale. Ulteriori valutazioni riguardano ALE-CLI, AndroidWorld e una serie di task interni. Nel subset Linux da 105 attività di Agents’ Last Exam, Holo4-27B raggiunge il 44,1% e Holo4-35B-A3B il 30,9%; su AndroidWorld i due modelli arrivano rispettivamente all’85,1% e al 77,6%. Nei test interni Agentic Task Factory che, secondo H Company, non sono stati utilizzati durante il training, Holo4-27B raggiunge l’80,2% nei task Web, l’89,4% in quelli basati su MCP e il 72,0% negli ambienti desktop. I risultati pubblicati sono stati ottenuti utilizzando l’harness di H Company e rappresentano mediamente da due a quattro esecuzioni, con una sola esecuzione per OSWorld 2.0 e ALE-CLI. I valori relativi agli altri modelli provengono invece da model card, leaderboard ufficiali e grafici pubblicati dai rispettivi fornitori e possono quindi derivare da harness e livelli di effort differenti. Per rendere verificabili le proprie valutazioni, H Company ha pubblicato le traiettorie utilizzate per ottenere i risultati dei benchmark pubblici, che possono essere riprodotte attraverso un viewer dedicato oppure scaricate come dataset da Hugging Face.

L’addestramento di Holo4 combina supervised fine-tuning e reinforcement learning su ambienti e attività che comprendono anche quelle generate con Agentic Task Factory, un insieme interno di pipeline capace di costruire ambienti interattivi e task verificabili partendo dalla sola documentazione, per esempio utilizzando screenshot di siti Web reali o software open source. Questo sistema ha prodotto finora circa 10.000 task: approssimativamente 4.000 riguardano applicazioni Web, mentre circa 3.000 sono dedicati ai server MCP e altri 3.000 agli ambienti desktop. Sono presenti anche ambienti ibridi nei quali lo stesso stato può essere manipolato sia attraverso un’interfaccia grafica sia mediante MCP. Il supervised fine-tuning è stato eseguito utilizzando 127 miliardi di token. Circa tre quarti del dataset sono costituiti da traiettorie agentiche concluse con successo, ripartite per il 45% su desktop, il 14% sul Web, il 12% tra MCP e API e il 3% su dispositivi mobili. La parte restante comprende ragionamento multimodale, GUI grounding, utilizzo di strumenti attraverso testo e attività di programmazione. Successivamente è stato applicato un reinforcement learning online asincrono su task a lungo orizzonte, con il quale sono stati addestrati due esperti LoRA specializzati: il primo dedicato a desktop e Web, il secondo a terminale, MCP e API. I due adapter sono stati quindi reintegrati nel modello ottenuto dal fine-tuning con peso uguale, senza ulteriori fasi di addestramento.

H Company ha inoltre ricostruito l’harness responsabile del ciclo di esecuzione delle azioni e della gestione del contesto dell’agente durante sequenze che possono estendersi per centinaia di passaggi. Lo sviluppo è stato guidato dai risultati ottenuti su OSWorld 2.0: gli agenti classificavano le cause del fallimento dei singoli task e gli ingegneri analizzavano le correzioni proposte. Tra le modifiche principali figurano un sistema di memoria più affidabile, capace di mantenere informazioni utili lungo centinaia di passaggi, e l’introduzione di una shell eseguita direttamente sulla macchina desktop sulla quale opera l’agente. Insieme ai modelli principali è stato rilasciato anche Holotron4 Nano, evoluzione di Holotron 3 sviluppata applicando lo stesso stack di post-training a Nemotron 3 Nano Omni nell’ambito della partecipazione di H Company alla NVIDIA Nemotron Coalition. Rispetto al modello di base, Holotron4 Nano passa dal 21,0% al 76,3% su OSWorld, dallo 0,2% al 7,9% su OSWorld 2.0, dal 19,4% al 35,6% su AutomationBench, dall’84,7% all’88,6% su PinchBench e dallo 0,6% all’8,5% su ALE Linux. I risultati vengono utilizzati da H Company per mostrare che la procedura di post-training può essere applicata anche a foundation model differenti e non dipende esclusivamente dalle dimensioni del modello.

H Company ha infine annunciato la pubblicazione di checkpoint DSpark drafter ottimizzati, prevista nei giorni successivi al rilascio di Holo4, con l’obiettivo di accelerare ulteriormente l’inferenza dei modelli.

Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)

Di Fantasy