OpenAI ha reso Auto-review gratuito per tutti gli utenti che utilizzano Codex effettuando l’accesso con un account ChatGPT, eliminando anche il consumo separato di token e delle quote associato al reviewer agent che controlla in background le azioni dell’agente principale. La modifica rappresenta il secondo aggiornamento della campagna di 28 giorni consecutivi dedicata da OpenAI al miglioramento di Codex ed è stata annunciata il 6 ottobre da Tibo Sottiaux, responsabile prodotto dell’azienda. Gli utenti possono attivare la funzione entrando nelle impostazioni e seguendo il percorso Permissions > Auto-review. L’obiettivo è consentire agli agenti di lavorare autonomamente più a lungo senza richiedere all’utente una sequenza continua di approvazioni manuali, mantenendo però un ulteriore livello di controllo sulle operazioni considerate rischiose o non coerenti con la richiesta originale.
Il problema affrontato riguarda in particolare il funzionamento standard del sandbox. Quando un agente deve compiere un’azione che modifica il file system, accede alla rete esterna oppure supera determinati limiti dell’ambiente protetto, la configurazione conservativa richiede normalmente una conferma da parte dell’utente. Questo approccio consente di mantenere un forte controllo umano sulle operazioni, ma diventa molto meno pratico nei task agentici complessi. Un’attività di coding che dura molte ore può attraversare decine di passaggi nei quali l’agente deve modificare file, installare dipendenze, eseguire comandi o recuperare informazioni esterne; se ciascuna operazione interrompe il processo in attesa di un click, il vantaggio dell’autonomia viene ridotto e l’utente si trova a effettuare ripetutamente decisioni molto simili. OpenAI descrive questo problema come decision fatigue, cioè una progressiva stanchezza decisionale che può rendere meno utile e persino meno sicuro un sistema di approvazioni apparentemente molto prudente.
Auto-review introduce per questo un secondo agente indipendente dal principale. Mentre l’agente operativo esegue il lavoro richiesto, il reviewer rimane attivo in background e ne valuta le azioni, cercando di stabilire se siano coerenti con l’obiettivo impostato dall’utente e se presentino un livello di rischio tale da dover essere bloccate. Invece di chiedere all’utente di approvare indiscriminatamente ogni operazione che supera il comportamento più restrittivo del sandbox, il sistema delega quindi parte di questa verifica a un agente specializzato. Un’azione normale e coerente può proseguire senza generare continuamente richieste di conferma, mentre un comportamento inatteso, una richiesta particolarmente rischiosa o un’operazione che sembra allontanarsi dallo scopo iniziale può essere fermata dal reviewer.
La funzione non costituisce però una sostituzione del sandbox vero e proprio. Il reviewer rimane un sistema AI che effettua una valutazione semantica e comportamentale, mentre i confini imposti dal sistema operativo, dal container o dall’ambiente sandbox rappresentano barriere tecniche separate. Proprio per questo la struttura può essere letta come un livello aggiuntivo tra l’autonomia completa e l’approvazione manuale di ogni singola operazione: Auto-review cerca di interpretare l’intenzione dell’utente e il rischio delle azioni, mentre il sandbox definisce ciò che il processo è fisicamente autorizzato a raggiungere. OpenAI stessa presenta la funzione come un complemento alle policy di sandboxing e non come un meccanismo destinato a eliminarle.
Un cambiamento importante riguarda la contabilizzazione del lavoro effettuato dal reviewer. In precedenza, il fatto che un secondo agente utilizzasse il modello in background comportava un consumo della quota disponibile e alcuni utenti avevano segnalato una diminuzione particolarmente rapida del proprio limite settimanale quando Auto-review rimaneva attivo durante sessioni di lunga durata. Con l’aggiornamento OpenAI ha eliminato sia il costo aggiuntivo in token sia il consumo separato delle quote per questa componente. L’utente paga quindi, o utilizza la propria allowance, per l’attività principale di Codex ma non perde capacità disponibile a causa del reviewer incaricato di sorvegliarla. La gratuità riguarda tutti gli utenti autenticati attraverso un account ChatGPT e non soltanto specifici livelli di abbonamento.
Il vantaggio operativo emerge soprattutto nei workflow nei quali Codex viene lasciato lavorare per periodi prolungati. Senza Auto-review, una sequenza di popup di approvazione può trasformare un task teoricamente autonomo in un processo che richiede comunque la presenza continua dell’utente; con la revisione automatizzata, l’agente può proseguire fra una fase e l’altra lasciando al sistema di controllo il compito di intercettare comportamenti anomali. OpenAI vuole quindi estendere l’autonomia temporale di Codex senza passare direttamente dall’estremo del controllo manuale completo a quello dell’agente libero di compiere qualsiasi azione permessa dall’ambiente.
La soluzione introduce inevitabilmente anche un secondo problema: l’AI incaricata di verificare un’altra AI può sbagliare a sua volta. Un reviewer potrebbe considerare sicura un’azione pericolosa, non riconoscere una sequenza di passaggi apparentemente innocui che produce complessivamente un effetto indesiderato oppure essere esposto a tecniche di bypass. Per questo la funzione non elimina la necessità di controlli forti sulle credenziali e sui privilegi quando Codex viene utilizzato su sistemi particolarmente importanti. Il confine hardware o software imposto dall’ambiente rimane più deterministico di una valutazione effettuata semanticamente da un modello, mentre Auto-review aggiunge una protezione capace di comprendere maggiormente il contesto ma non di offrire la stessa garanzia tecnica di un isolamento a livello di sistema operativo.
La distinzione è particolarmente importante quando l’agente può accedere a repository sensibili, segreti, servizi cloud o ambienti di produzione. In tali condizioni, la presenza del reviewer non implica che debba essere concessa all’agente una quantità illimitata di privilegi: l’approccio più sicuro continua a prevedere credenziali limitate, ambienti isolati e il principio del minimo privilegio, utilizzando Auto-review per ridurre le continue interruzioni all’interno del perimetro già autorizzato. Il vantaggio della funzione riguarda quindi soprattutto la gestione delle decisioni operative ordinarie e il riconoscimento di deviazioni rispetto all’intenzione originaria dell’utente.
La modifica si inserisce nella strategia con cui OpenAI sta progressivamente trasformando Codex da assistente di programmazione interattivo a sistema capace di sostenere workload agentici sempre più lunghi. L’azienda ha avviato un ciclo di 28 giorni di aggiornamenti consecutivi dedicati al prodotto; il primo giorno era stato annunciato un incremento del 50% della velocità di elaborazione, mentre il secondo si concentra sulla possibilità di mantenere l’agente in esecuzione riducendo il numero di interruzioni richieste all’utente. Auto-review affronta quindi non tanto il livello di intelligenza del modello quanto uno dei problemi infrastrutturali che emergono quando il software viene lasciato operare autonomamente: decidere quali azioni possano essere eseguite senza la continua presenza di una persona.
OpenAI definisce Auto-review una safety net destinata a impedire azioni ad alto rischio e comportamenti che si discostano dall’intenzione iniziale dell’utente. La gratuità e l’eliminazione del consumo delle quote cercano di trasformare questo controllo in una componente standard del workflow anziché in una funzione che gli utenti possano essere incentivati a disabilitare per risparmiare token. L’effetto pratico è un’architettura nella quale l’agente operativo e l’agente revisore lavorano contemporaneamente: il primo tenta di completare il compito, il secondo valuta ciò che sta per fare, mentre sandbox e permessi continuano a costituire il limite tecnico esterno entro il quale entrambi operano.
Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)
