Immagine AI

Jev, un modello di intelligenza artificiale specializzato nella presa di decisioni sviluppato dalla startup Standard Agents, ha completato Pokémon Rosso in circa una settimana, sconfiggendo i Superquattro e il Campione e raggiungendo così la Hall of Fame del gioco. Il risultato è particolarmente rilevante perché esperimenti precedenti condotti con chatbot e grandi modelli linguistici avevano richiesto da diverse settimane a mesi per completare lo stesso tipo di percorso. Jev non opera però come un normale LLM: non legge direttamente lo schermo, non interpreta autonomamente immagini o testo e non genera liberamente le proprie azioni. Riceve invece informazioni già strutturate sullo stato del gioco insieme a un insieme di possibili azioni predisposte in anticipo e seleziona, tra quelle disponibili, quella che ritiene più probabile o appropriata. Pokémon viene utilizzato da tempo come banco di prova per gli agenti AI perché costringe il sistema a gestire contemporaneamente esplorazione geografica, dialoghi, combattimenti a turni, inventario, gestione della squadra, obiettivi intermedi e pianificazione a lungo termine, rendendo insufficiente una semplice capacità di risposta locale. Nel caso di Jev, tuttavia, l’esperimento non è stato basato sull’impiego continuo di un grande modello linguistico per prendere ogni singola decisione: il sistema ha combinato un modello specializzato e relativamente leggero con Claude Opus 5, utilizzato come supervisore e come strumento per migliorare progressivamente il modo in cui le informazioni venivano presentate al modello decisionale. Questo approccio ha attirato attenzione soprattutto perché consente di ridurre drasticamente l’impiego di token e di risorse rispetto a esperimenti nei quali un grande LLM viene interrogato continuamente per decidere ogni movimento.

Claude Opus 5 ha svolto principalmente il ruolo di coach durante l’intera partita, monitorando in tempo reale i log prodotti da Jev e intervenendo sulla struttura dei dati e sull’elenco delle azioni disponibili quando il modello entrava in situazioni di stallo. Se Jev continuava a muoversi ripetutamente nello stesso punto, imboccava percorsi senza uscita o non riusciva a individuare l’azione necessaria per proseguire, Opus 5 analizzava la sequenza degli eventi e modificava il modo in cui le informazioni venivano trasmesse al modello, senza assumere direttamente il controllo del personaggio. Nel corso della partita sono state registrate 474 modifiche all’harness, cioè al livello software che collega il modello al gioco e decide quali informazioni fornirgli e in quale forma. Gli errori commessi mostrano quanto potesse essere fragile il comportamento del sistema: Jev ha tentato per 53 volte di raggiungere l’ingresso chiuso di Lorelei e, all’interno della Grotta Rocciosa, è salito e sceso dalla stessa scala 124 volte nell’arco di circa dieci minuti. Anche il percorso finale non è stato lineare: durante il primo confronto con il Campione, Jev è stato sconfitto da Alakazam ed è quindi stato costretto ad affrontare nuovamente l’intera sequenza dei Superquattro prima di riuscire infine a sconfiggere il rivale Blu e diventare Campione. Il risultato finale deriva quindi non dall’assenza di errori, ma dalla capacità dell’intero sistema di riconoscere e correggere progressivamente comportamenti inefficaci durante un’attività prolungata.

Il contributo di Claude Opus 5 ha riguardato anche l’ottimizzazione dei costi e dell’efficienza del sistema. Nel corso dell’esperimento, la quantità di testo fornita a Jev è stata ridotta a circa un terzo rispetto alla configurazione iniziale, eliminando informazioni ridondanti e semplificando il formato utilizzato per descrivere lo stato del gioco. Alcuni valori numerici sono stati inoltre sostituiti con parole, perché questa rappresentazione risultava più facile da gestire per il modello decisionale. Quando Jev entrava in loop ripetitivi, il sistema modificava anche la frequenza con cui gli veniva richiesto di scegliere una nuova azione: l’intervallo, normalmente vicino a un secondo, poteva essere portato fino a circa sei secondi, evitando di consumare risorse continuando a chiedere decisioni mentre il personaggio ripeteva sostanzialmente lo stesso comportamento. La struttura dell’esperimento separava quindi chiaramente due livelli: Jev prendeva le decisioni operative all’interno del gioco, mentre Claude Opus 5 interveniva sul contesto, sulle regole e sulla qualità dei dati che rendevano possibili quelle decisioni. Anche gli spettatori della diretta hanno partecipato indirettamente al processo, fornendo nella chat suggerimenti utili alla progressione; quando una di queste informazioni veniva considerata valida, poteva essere incorporata nell’elenco delle opzioni o nella struttura dei dati presentati a Jev. Il risultato è stato quindi ottenuto attraverso una combinazione di modello decisionale specializzato, LLM generalista, interventi degli sviluppatori e contributi umani provenienti dal pubblico, piuttosto che attraverso un singolo agente completamente autonomo.

L’esperimento mostra soprattutto un’architettura alternativa rispetto all’approccio nel quale un grande modello linguistico viene utilizzato per ogni passaggio di un’attività agentica. In questo caso la scelta dell’azione viene affidata a un modello specificamente progettato per prendere decisioni a partire da un insieme limitato di alternative, mentre il modello generalista viene impiegato soltanto a un livello superiore per analizzare fallimenti, modificare il contesto e migliorare il funzionamento dell’harness. Questa separazione permette di utilizzare le capacità più costose di un LLM soltanto quando sono realmente necessarie e di affidare invece il flusso operativo continuo a un componente più specializzato e meno dispendioso. Pokémon Rosso costituisce un ambiente particolarmente adatto a questo tipo di prova perché richiede migliaia di decisioni consecutive e mantiene dipendenze tra azioni compiute a grande distanza temporale: una strategia inefficiente nell’utilizzo dei token diventa quindi rapidamente costosa, mentre piccoli errori di navigazione o interpretazione possono produrre cicli molto lunghi. Il completamento del gioco in una settimana evidenzia così il potenziale di sistemi nei quali modelli differenti ricoprono ruoli distinti, con un componente specializzato che esegue continuamente le decisioni e un modello generalista che interviene soltanto per ristrutturare l’ambiente informativo e correggere i problemi che emergono durante l’esecuzione prolungata.

Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)

Di Fantasy