Immagine AI

Microsoft ha presentato il 7 ottobre 2026 una versione ottimizzata per l’esecuzione locale di MAI-Code-1.1-Flash, modello di intelligenza artificiale specializzato nella programmazione e nell’utilizzo degli strumenti di sviluppo software. L’aggiornamento accompagna l’introduzione dei nuovi computer Surface Laptop Ultra e Surface RTX Spark Dev Box, entrambi basati sulla piattaforma NVIDIA RTX Spark, e permette di eseguire direttamente sul PC attività di generazione, analisi e modifica del codice che normalmente richiederebbero l’accesso a un modello ospitato su server cloud. MAI-Code-1.1-Flash era già stato presentato nell’agosto 2026, ma la nuova configurazione introduce ottimizzazioni specifiche per la memoria e per le capacità computazionali dei dispositivi Windows ad alte prestazioni. Il modello comprende complessivamente circa 137 miliardi di parametri, dei quali 6,8 miliardi vengono attivati durante una singola operazione di inferenza. Questa caratteristica consente di utilizzare un’architettura di grandi dimensioni riducendo la quantità di calcolo effettivamente richiesta per ciascun token, mentre la nuova procedura di quantizzazione ridimensiona ulteriormente l’occupazione della memoria necessaria a conservarne i pesi. L’obiettivo di Microsoft è rendere possibile lo sviluppo di applicazioni software e l’esecuzione di agenti di programmazione direttamente sul dispositivo, mantenendo capacità operative vicine a quelle della versione cloud e limitando la necessità di inviare continuamente richieste a infrastrutture esterne.

L’ottimizzazione si basa principalmente sull’applicazione di tecniche di quantizzazione e speculative decoding. La quantizzazione riduce la precisione numerica utilizzata per rappresentare i pesi del modello, sostituendo formati più onerosi in termini di memoria con rappresentazioni compatte progettate per preservare quanto possibile le prestazioni. Nella nuova configurazione, Microsoft utilizza una precisione media di circa 3 bit per peso, portando le dimensioni del modello a circa 53 GB. Rispetto alla versione originale rappresentata in formato BF16, la riduzione dell’occupazione dei pesi raggiunge approssimativamente l’80%. Il confronto riguarda la memoria richiesta per conservare il modello e non deve essere confuso con l’occupazione totale durante l’esecuzione, che comprende anche strutture temporanee, informazioni di contesto e risorse utilizzate dal runtime. Microsoft ha infatti dichiarato che, con una finestra di contesto di 256.000 token, la configurazione locale può contenere l’utilizzo massimo della memoria entro circa 75,5 GB. Questo valore colloca il modello all’interno delle capacità dei sistemi RTX Spark equipaggiati con 128 GB di memoria unificata, lasciando una parte delle risorse disponibili per il sistema operativo e gli altri componenti software. La dimensione effettiva della memoria utilizzata dipende comunque dalla lunghezza del contesto e dalle condizioni operative del modello.

La seconda tecnica adottata, lo speculative decoding, interviene invece sul processo di generazione del testo e del codice. Questa procedura utilizza meccanismi di previsione e verifica destinati ad accelerare la produzione dei token, riducendo il tempo necessario a ottenere una risposta senza richiedere che l’intera generazione venga eseguita esclusivamente attraverso il procedimento autoregressivo tradizionale. L’applicazione congiunta di quantizzazione e decodifica speculativa permette di ridurre l’occupazione della memoria e migliorare la velocità operativa, mantenendo al tempo stesso le capacità del modello nell’esecuzione di attività di programmazione articolate. La struttura con 137 miliardi di parametri complessivi e 6,8 miliardi di parametri attivi consente inoltre di combinare una capacità rappresentazionale elevata con una quantità di calcolo per token inferiore a quella di un modello denso che utilizzi indiscriminatamente tutti i parametri durante ogni passaggio. L’efficienza ottenuta rende possibile la distribuzione su workstation personali dotate di GPU ad alte prestazioni e memoria unificata, pur mantenendo requisiti hardware considerevolmente superiori a quelli di un normale computer destinato alle attività d’ufficio.

Microsoft ha confrontato la versione locale ottimizzata con il modello originale ospitato nel cloud attraverso benchmark specifici per lo sviluppo software. Nel test SWE-bench Verified, che valuta la capacità di risolvere problemi reali relativi a repository e progetti software, la configurazione locale ha ottenuto una percentuale del 70,8%, rispetto al 72,6% della versione cloud. La differenza di 1,8 punti percentuali evidenzia una riduzione relativamente contenuta del risultato, nonostante la diminuzione significativa della memoria necessaria a rappresentare il modello. Nel benchmark Terminal-Bench 2.1, dedicato all’esecuzione di attività attraverso un ambiente terminale e all’utilizzo operativo degli strumenti di sviluppo, la versione locale ha invece raggiunto il 66,3%, superando il 62,9% registrato dalla configurazione cloud originale. Queste misurazioni indicano che la compressione del modello non ha comportato un deterioramento uniforme delle capacità e che, almeno nei test considerati, la configurazione ottimizzata conserva prestazioni competitive. I benchmark valutano tuttavia procedure specifiche e non implicano automaticamente risultati equivalenti in qualsiasi progetto aziendale, linguaggio di programmazione o ambiente software. Microsoft presenta i dati soprattutto per dimostrare la possibilità di mantenere un livello elevato di capacità agentiche anche quando un modello di grandi dimensioni viene adattato ai vincoli computazionali dei dispositivi personali.

L’esecuzione locale di MAI-Code-1.1-Flash viene integrata negli strumenti destinati alla programmazione assistita da intelligenza artificiale, compreso GitHub Copilot. Attraverso l’instradamento intelligente delle richieste, il sistema può assegnare determinate attività a modelli residenti sul dispositivo anziché inviarle necessariamente al cloud. Questo approccio permette di utilizzare le risorse hardware disponibili per generare codice, analizzare repository, individuare errori, esaminare problemi di compilazione e proporre modifiche ai programmi. Il funzionamento locale assume particolare rilevanza quando gli agenti devono eseguire numerosi passaggi successivi, poiché ciascuna operazione può richiedere nuove inferenze per interpretare gli strumenti, valutare i risultati ed elaborare la fase seguente. La possibilità di gestire una parte delle richieste direttamente sul computer riduce la dipendenza dai costi di elaborazione remota e consente di sperimentare procedure complesse senza fatturazione API per ogni singolo passaggio locale. Microsoft non presenta tuttavia l’elaborazione on-device come una sostituzione completa del cloud, ma come una componente di un’infrastruttura ibrida nella quale il sistema può scegliere dinamicamente le risorse più appropriate per il compito richiesto.

La disponibilità di modelli locali viene collegata anche alla funzione Code in Copilot, attraverso la quale gli utenti possono descrivere un’applicazione utilizzando il linguaggio naturale e ottenere software destinato all’ambiente Windows. Il sistema può generare codice e utilizzare strumenti di sviluppo direttamente sul computer, rendendo possibile la creazione di applicazioni personalizzate senza dover necessariamente seguire l’intero processo tradizionale di progettazione e implementazione manuale. Le applicazioni prodotte possono essere sviluppate e utilizzate nell’ambiente desktop, senza dipendere obbligatoriamente dalla distribuzione attraverso uno store. Le capacità del modello comprendono inoltre l’utilizzo di strumenti e comandi operativi, aspetto che distingue l’assistenza alla programmazione basata su agenti dalla semplice generazione di frammenti di codice. Un agente può ricevere un incarico, consultare il progetto, proporre modifiche, richiamare comandi di verifica ed esaminare l’esito delle operazioni. Per questa ragione Microsoft ha affiancato all’ottimizzazione del modello un’infrastruttura specifica per controllare l’esecuzione e limitare l’accesso alle risorse del dispositivo.

Il controllo di sicurezza viene realizzato attraverso Microsoft Execution Containers, denominato MXC, un sistema di isolamento integrato in Windows 11 e destinato all’esecuzione degli agenti AI. L’infrastruttura permette di definire quali risorse locali, file, processi e destinazioni di rete possano essere utilizzati da un agente, applicando le restrizioni durante il funzionamento. L’isolamento evita che un software autonomo possa accedere indistintamente a tutte le informazioni e ai privilegi dell’utente principale, introducendo una separazione tra il contesto operativo dell’agente e quello della sessione desktop. Gli sviluppatori possono configurare le risorse autorizzate e utilizzare ambienti controllati per verificare il comportamento del codice generato. MXC supporta differenti modalità di contenimento e viene integrato con le capacità di gestione aziendale previste dall’ecosistema Windows. Questa architettura è particolarmente importante nell’utilizzo di agenti di programmazione, poiché la possibilità di generare ed eseguire comandi all’interno del sistema operativo introduce requisiti di sicurezza differenti rispetto alla semplice produzione di suggerimenti testuali. L’obiettivo consiste nel permettere agli agenti di svolgere attività concrete senza attribuire loro automaticamente un accesso illimitato al dispositivo.

Le ottimizzazioni software sono state presentate in concomitanza con Surface Laptop Ultra, un computer basato su NVIDIA RTX Spark con una GPU Blackwell RTX, CPU Grace e configurazioni fino a 128 GB di memoria unificata. La piattaforma raggiunge una capacità teorica dichiarata di un petaflop nelle operazioni AI FP4 e supporta l’esecuzione locale di modelli superiori a 120 miliardi di parametri. Le caratteristiche della memoria unificata permettono a CPU e GPU di condividere le risorse necessarie alle elaborazioni, rendendo più praticabile l’utilizzo di modelli quantizzati di dimensioni considerevoli. La nuova famiglia hardware comprende anche Surface RTX Spark Dev Box, una workstation compatta sviluppata per attività continuative di sviluppo e sperimentazione AI. L’integrazione tra modelli ottimizzati, strumenti di programmazione e infrastrutture di isolamento costituisce il fondamento della strategia Microsoft per l’esecuzione di agenti locali, nella quale la capacità computazionale del PC viene utilizzata per svolgere autonomamente attività che richiederebbero altrimenti numerose interazioni con i servizi cloud. Il risultato è una configurazione nella quale un modello specializzato da 137 miliardi di parametri può essere distribuito su workstation Windows dotate di memoria e accelerazione adeguate, conservando una parte significativa delle prestazioni misurate nella versione originale ospitata sui server.

Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)

Di Fantasy