Google Research e Virginia Tech hanno sviluppato WikiSkill, un framework che permette agli agenti AI di trasformare le proprie esperienze passate, comprese quelle fallimentari, in conoscenza strutturata e competenze riutilizzabili senza inserire tutta questa memoria direttamente nel prompt operativo. Il sistema nasce da un limite tipico dei framework di skill evolution: gli agenti possono analizzare traiettorie riuscite e fallite e proporre modifiche alle proprie skill, ma spesso perdono la diagnosi che aveva portato a quelle modifiche, compresi i tentativi che non avevano superato la validazione, finendo così per riscoprire gli stessi problemi in iterazioni successive. WikiSkill inserisce quindi un livello di conoscenza persistente tra le tracce grezze dell’agente e le skill eseguibili, costruendo una sorta di wiki interna che conserva schemi ricorrenti di successo e fallimento, tentativi precedenti e risultati delle modifiche.
L’architettura è suddivisa in tre livelli. Il Raw Layer conserva le execution trace immutabili, comprendenti azioni, ragionamento, chiamate agli strumenti, risultati ottenuti e risposta finale; il Wiki Layer trasforma queste tracce in pagine strutturate dedicate ai failure mode ricorrenti, alle strategie efficaci, alla cronologia dell’evoluzione e all’impatto delle diverse modifiche; lo Skill Layer contiene invece le istruzioni procedurali effettivamente utilizzate dall’agente durante l’esecuzione. Ogni ciclo di evoluzione prevede quattro passaggi: un Inference Agent esegue i task con le skill correnti, un Wiki Maintainer analizza un campione di traiettorie riuscite e fallite e aggiorna la knowledge base, uno Skill Proposer consulta wiki e tracce per proporre nuove skill o modifiche a quelle esistenti, quindi il nuovo set viene testato su un validation set e accettato soltanto se supera il miglior risultato ottenuto fino a quel momento.
Un esempio su ALFWorld mostra il meccanismo in modo concreto. Il sistema aveva individuato un comportamento ricorrente nel quale l’agente prendeva un oggetto, lo esaminava e lo riportava continuamente nella posizione iniziale. Una prima skill generica proposta per correggere il problema non aveva superato la validazione, ma WikiSkill aveva conservato sia il pattern osservato sia l’esito negativo della modifica. Nell’iterazione successiva, lo Skill Proposer ha quindi formulato una regola più specifica per interrompere il ciclo di ripetizione, imponendo di non riportare un oggetto nella sua posizione originaria; questa modifica ha migliorato le prestazioni ed è stata accettata. Quando nuove traiettorie hanno evidenziato un altro schema di looping, il sistema ha potuto perfezionare la stessa skill invece di ripartire da zero.
WikiSkill è stato testato su cinque benchmark relativi a ragionamento matematico, web search, fogli di calcolo, question answering su documenti lunghi e attività interattive domestiche, utilizzando modelli Qwen, Gemma e Gemini e confrontandolo con Trace2Skill, EvoSkill, SkillOpt e agenti privi di skill. Nei test ha ottenuto il punteggio medio più alto con ogni modello, con un vantaggio compreso tra 3,3 e 12 punti percentuali rispetto al miglior metodo concorrente di skill evolution per ciascuna configurazione. All’interno della famiglia Qwen, il beneficio rispetto alla baseline senza skill è cresciuto con la dimensione del modello: +12,3 punti con 4B, +17,5 con 9B e +23,9 con 27B. In un confronto separato, Qwen-3.5-9B con WikiSkill ha raggiunto un’accuratezza media del 47,4%, contro il 39,4% di Qwen-3.6-27B senza skill; inoltre, su ALFWorld, Qwen-3.5-9B ha ottenuto il 70,2% usando una skill evoluta dal modello Qwen-3.6-27B, rispetto al 63,4% ottenuto con una skill sviluppata autonomamente, indicando una certa trasferibilità delle competenze tra modelli differenti.
Uno degli aspetti centrali è la separazione tra memoria estesa e prompt operativo. La wiki non viene normalmente inserita nel contesto dell’Inference Agent: rimane disponibile al Wiki Maintainer e allo Skill Proposer, mentre durante l’esecuzione vengono utilizzate soltanto skill compatte, lunghe nei test tra circa 45 e 129 righe. Negli esperimenti di ablazione con Gemini-3.5-Flash su quattro benchmark, la configurazione standard ha raggiunto una media del 63,7%; rimuovendo Wiki Maintainer e accesso alla wiki per lo Skill Proposer il risultato è sceso al 48,7%, mentre fornendo la wiki anche all’Inference Agent la media è diminuita al 60,9%. Secondo i ricercatori, permettere all’agente operativo di risolvere direttamente i task utilizzando la memoria della wiki può mascherare le debolezze delle skill, producendo traiettorie meno utili per capire quali procedure debbano essere realmente corrette.
Questo approccio riduce il costo del contesto durante l’inferenza, ma sposta maggiore lavoro nella fase di evoluzione. Lo Skill Proposer utilizza infatti un processo ReAct nel quale alterna ragionamento e chiamate agli strumenti mentre consulta wiki e tracce, richiedendo nei test circa 10-20 turni per ciascuna iterazione oltre alla chiamata del Wiki Maintainer. Poiché però l’intero training set viene elaborato in batch, il numero di chiamate LLM dell’ottimizzatore per iterazione non cresce direttamente con il numero di esempi. Il framework risulta quindi particolarmente adatto ad agenti che eseguono ripetutamente workflow multi-step e accumulano una quantità sufficiente di storico perché emergano errori ricorrenti e strategie efficaci.
Restano comunque diversi problemi aperti. WikiSkill inserisce tutte le skill attive direttamente nel prompt e non affronta ancora il retrieval selettivo quando il numero delle competenze cresce molto; il sistema di validazione scarta inoltre una modifica se non produce un miglioramento immediato, anche quando potrebbe rappresentare un passaggio utile per evoluzioni successive. La wiki continua poi ad aumentare di dimensione e non dispone ancora di un meccanismo automatico di pruning, mentre i test non coprono attività che richiedono centinaia di azioni o sessioni della durata di diverse ore. Tra le linee di ricerca già indicate figurano quindi la pulizia automatica della knowledge base e l’adattamento online delle skill durante task particolarmente lunghi.
Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)
