OpenAI ha esteso in modo significativo le capacità vocali di ChatGPT introducendo il supporto ai plugin all’interno della modalità Live Voice su web, iOS e Android e rendendo contemporaneamente disponibile la voce anche in ChatGPT Work su web e mobile. L’aggiornamento consente di utilizzare durante una conversazione parlata i plugin e le applicazioni già collegate all’account, mantenendo le autorizzazioni, le connessioni esistenti e i limiti previsti dal proprio piano. Durante una sessione Live l’utente può quindi chiedere direttamente a ChatGPT di usare un plugin disponibile, continuando a seguire nella stessa chat anche le risposte in forma scritta. Se l’applicazione richiesta non è ancora collegata può essere necessario completare prima l’accesso e l’autorizzazione, mentre le restrizioni eventualmente applicate da un’organizzazione o da uno spazio di lavoro restano valide anche nella modalità vocale. Quando un’azione richiede un’approvazione esplicita, ChatGPT mostra sullo schermo i controlli necessari per esaminarla, approvarla o rifiutarla: la conferma non può essere impartita soltanto a voce, mantenendo quindi un passaggio visivo per le operazioni che necessitano dell’autorizzazione dell’utente. Anche gli utenti Free e Go possono utilizzare Voice in Chat con i plugin compatibili con il rispettivo piano, mentre il supporto effettivo delle singole applicazioni continua a dipendere da disponibilità, autorizzazioni, regione, versione dell’app e impostazioni dell’account.
L’integrazione con ChatGPT Work modifica invece il modo in cui possono essere avviate e gestite le attività più lunghe e multi-step. Da web o dispositivo mobile è ora possibile parlare direttamente a Work e chiedergli di creare documenti, presentazioni o fogli di calcolo, recuperare informazioni dalle app collegate oppure operare attraverso il browser per eseguire procedure articolate. Il comando vocale diventa quindi un punto d’ingresso per attività che non si esauriscono nella conversazione immediata ma possono proseguire attraverso più strumenti, file e passaggi operativi. Se un task è ancora in corso quando la sessione Voice viene terminata, l’attività può continuare successivamente nella conversazione testuale, senza richiedere che l’interazione vocale rimanga aperta per tutta la durata del lavoro. Per utilizzare questa funzione l’account deve avere accesso sia a Voice sia a Work e le attività avviate parlando consumano il normale utilizzo previsto per Work esattamente come quelle impartite tramite testo, mentre la componente vocale segue separatamente i limiti e la fatturazione Voice del piano. L’esperienza si affianca alla Voice già disponibile nell’app desktop ChatGPT per macOS e Windows, dove gli utenti possono avviare task, verificarne l’avanzamento, interrogare i propri agenti e coordinare più agenti attraverso una singola conversazione vocale.
La base tecnica della nuova esperienza è GPT-Live-1, utilizzato nei piani a pagamento, mentre gli utenti Free accedono a GPT-Live-1 mini. A differenza delle precedenti architetture vocali strettamente turn-by-turn, GPT-Live-1 è progettato per ascoltare e parlare contemporaneamente, gestendo in modo più naturale interruzioni, sovrapposizioni e cambi di turno nella conversazione. Live opera direttamente all’interno di una normale chat ChatGPT, dove l’audio è affiancato dal testo in streaming e può essere combinato con ricerca sul web, memoria, immagini e risultati visuali prodotti dai widget supportati. Dal 9 settembre 2026 Voice può inoltre ricorrere a GPT-5.6 o GPT-6 Astra quando una richiesta necessita di ricerca o ragionamento più complessi, con la possibilità di scegliere modello e livello di ragionamento usando gli stessi controlli disponibili nella chat testuale. La stessa architettura GPT-Live-1 è stata resa disponibile anche attraverso API per la costruzione di agenti vocali, con delega di ragionamento e tool calling a modelli backend come GPT-6 Astra o a modelli di terze parti, mentre il modello vocale gestisce direttamente l’interazione audio, il ritmo, il tono, le interruzioni, il rumore di fondo e le sessioni prolungate. OpenAI distingue attualmente tre modalità Voice: Live, basata su GPT-Live-1 o GPT-Live-1 mini e orientata alla conversazione full-duplex; Advanced, che mantiene alcune capacità della precedente esperienza real-time, tra cui video e condivisione dello schermo sui dispositivi supportati; Standard, che funziona invece in modalità più tradizionale trascrivendo prima il parlato e generando poi la risposta.
I limiti di utilizzo della Live Voice vengono calcolati su una finestra mobile di 24 ore e variano in base al piano. Gli utenti Go possono utilizzare fino a 3 ore di GPT-Live-1 mini, gli utenti Plus fino a 3 ore con GPT-Live-1, mentre il piano Pro da 100 dollari al mese arriva a 15 ore e quello Pro da 200 dollari offre utilizzo illimitato di GPT-Live-1. Per gli ambienti Business, le licenze Standard includono fino a 3 ore con GPT-Live-1 e quelle Premium fino a 15 ore; l’utilizzo aggiuntivo nei piani Business viene conteggiato a 1,25 crediti al minuto. Nei workspace Enterprise, Edu e Healthcare basati su crediti viene applicata la stessa tariffa di 1,25 crediti al minuto, mentre per Enterprise con pricing basato sull’utilizzo il costo indicato è di 0,05 dollari al minuto. L’uso di modelli più avanzati per ricerca e ragionamento segue invece i normali limiti e costi del modello selezionato, separatamente dal consumo della componente Voice. Con gli aggiornamenti di settembre OpenAI ha inoltre eliminato per Plus e Pro il precedente passaggio automatico a GPT-Live mini dopo il raggiungimento del limite della modalità principale e ha ritirato i livelli separati Instant, Medium e High che in precedenza regolavano l’intelligenza della modalità vocale.
Restano comunque alcune differenze importanti tra Live e le altre modalità. Live non supporta attualmente video o condivisione dello schermo, funzioni per le quali continua a essere necessario utilizzare Advanced sui dispositivi compatibili, e non può ancora cercare o aggiungere direttamente file presenti nella ChatGPT Library, anche se i file supportati possono essere allegati manualmente alla conversazione quando previsto dall’account. L’arrivo dei plugin colma invece una delle principali limitazioni iniziali di GPT-Live-1, che al lancio non aveva accesso alle app collegate. L’evoluzione è stata piuttosto rapida: GPT-Live-1 è arrivato in ChatGPT Voice l’8 luglio 2026, ChatGPT Work è stato introdotto il giorno successivo come ambiente agentico per attività complesse attraverso file, applicazioni e browser, Voice è stata poi estesa a Work e Codex nell’app desktop il 23 luglio e alla fine di agosto le conversazioni Live hanno ottenuto supporto per Live Activities su iPhone, con informazioni visualizzabili sulla schermata di blocco e, sui modelli compatibili, nella Dynamic Island. Con l’aggiornamento del 23 settembre la voce passa quindi da semplice interfaccia conversazionale a strumento utilizzabile anche per attivare applicazioni esterne e avviare workflow agentici complessi, mantenendo nello stesso ambiente la continuità tra input parlato, risposte testuali, strumenti collegati e attività eseguite da Work.
Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)
