Upstage ha lanciato Solar Mini 4, un small language model progettato per attività agentiche ripetitive e per workload aziendali ad alto volume, affiancandolo a Solar Pro 4 in una strategia a due livelli che separa i compiti più complessi da quelli orientati soprattutto ad automazione, estrazione di informazioni e utilizzo degli strumenti. Solar Mini 4 utilizza un’architettura Mixture-of-Experts con 35 miliardi di parametri complessivi, ma ne attiva soltanto 3 miliardi per ogni token elaborato, riducendo la quantità di calcolo richiesta durante l’inferenza. Il modello supporta una context window fino a 512.000 token e output fino a 128.000 token ed è stato progettato per attività come recupero di informazioni, produzione di output strutturati, classificazione, verifica di documenti e tool calling. Nel benchmark Artificial Analysis Intelligence Index v4.3.2 ha ottenuto 24,1 punti, il risultato più alto tra i modelli con 3 miliardi di parametri attivi inclusi nel confronto, davanti a Qwen 3.6 35B-A3B e Nemotron 3.5 Lightning; Upstage evidenzia inoltre risultati superiori anche rispetto ad alcuni modelli con un numero molto maggiore di parametri attivi, tra cui Gemma 4 31B e Nemotron 3 Ultra.
Le valutazioni pubblicate mostrano anche risultati specifici nei compiti agentici e di ragionamento: Solar Mini 4 ha raggiunto il 22,3% su AutomationBench-AA, che misura l’esecuzione di workflow multi-step all’interno di applicazioni SaaS reali, e 47,2 su τ³-Banking, dedicato all’applicazione di policy e all’utilizzo di strumenti durante interazioni articolate su più turni. Nei benchmark più generali ha ottenuto 83,3% su AA-LCR per il ragionamento su contesti lunghi, 47,6% su SciCode per problemi scientifici basati sul codice e 19,6% su Humanity’s Last Exam. Il modello supporta tool calling e chiamate parallele a più strumenti, JSON mode e output vincolati da JSON Schema, mentre il reasoning non viene attivato necessariamente per impostazione predefinita: gli sviluppatori possono regolare il parametro reasoning_effort in base alla complessità del compito, bilanciando capacità di analisi, numero di token generati e tempi di risposta. In un test interno con 32 richieste concorrenti su due GPU H100, Upstage dichiara oltre 70 token al secondo per richiesta; la società precisa però che i 3 miliardi di parametri attivi non corrispondono alla memoria necessaria per il deployment, perché devono comunque essere caricati i pesi dell’intero modello da 35 miliardi. In versione quantizzata Solar Mini 4 può essere eseguito on-premise su una singola H100 da 80 GB.
Il posizionamento di Solar Mini 4 è legato soprattutto al costo di esecuzione di flussi ripetitivi su larga scala. In un test interno basato su tre attività agentiche in coreano, comprendenti analisi del codice e coordinamento di calendari attraverso più strumenti, Upstage ha stimato un costo di 1,25 dollari per 1.000 set di attività con Solar Mini 4 contro 2,20 dollari con MiMo-V2.5, circa il 43% in meno, con entrambi i modelli capaci di superare i controlli qualitativi previsti. Nel solo workflow multi-step che richiedeva di controllare un calendario, identificare i partecipanti, inviare messaggi e riepilogare il risultato, il costo stimato per 1.000 esecuzioni è stato di 0,36 dollari contro 0,61 dollari. Upstage propone quindi Solar Mini per automazione di workflow interni, elaborazione e validazione di documenti, estrazione di dati e task ripetitivi, mentre Solar Pro viene destinato ad attività agentiche più complesse nelle quali sono richiesti livelli maggiori di ragionamento e pianificazione.
Solar Mini 4 è disponibile tramite Upstage Console API, Solar Chat e OpenRouter e supporta anche il deployment on-premise; dal 5 ottobre sarà inoltre utilizzabile gratuitamente per un periodo limitato attraverso Hermes Agent. Il prezzo API standard indicato da Upstage è di 0,10 dollari per milione di token in input, 0,01 dollari per milione di token di input memorizzati in cache e 0,40 dollari per milione di token in output, con una promozione di lancio del 70% attraverso Upstage Console fino al 10 ottobre. L’API è compatibile con l’SDK OpenAI per le funzioni supportate e consente di integrare direttamente il modello in pipeline documentali, sistemi interni e applicazioni agentiche, mentre la disponibilità on-premise rende possibile utilizzarlo anche in ambienti nei quali dati e inferenza devono rimanere all’interno dell’infrastruttura aziendale.
Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)
