Google ha introdotto Gemini 3.8 Live con Live Avatar, una nuova funzione che aggiunge una presenza visiva generata in tempo quasi reale ai modelli di dialogo nativi di Gemini, combinando conversazione vocale, comprensione visiva e streaming video a bassa latenza. Il sistema ascolta, osserva e risponde attraverso una persona digitale animata, sincronizzando il movimento delle labbra con il parlato, adattando le espressioni del volto e gestendo i turni di conversazione in modo continuo. Live Avatar è disponibile dal 24 settembre 2026 in Gemini Enterprise attraverso endpoint negli Stati Uniti e nell’Unione Europea, dopo una precedente anteprima presentata durante Google Cloud Next 2026, e viene proposto per scenari aziendali come assistenza clienti, procedure guidate, interazioni commerciali e servizi nei quali l’agente deve mantenere un contatto visivo e vocale mentre accede contemporaneamente a sistemi esterni. La disponibilità enterprise comprende opzioni di provisioned throughput, requisiti di compliance e strumenti di governance dei dati, mentre le aziende possono provare il modello dalla console di Gemini Enterprise oppure integrarlo attraverso la Gemini Live API. Per configurazioni con capacità riservata, architetture di deployment personalizzate e accesso alla creazione di avatar custom è invece previsto il coinvolgimento diretto di Google Cloud. Live Avatar si inserisce nella famiglia Gemini 3.8 Live presentata il 15 settembre, che comprende Gemini 3.8 Live, destinato a conversazioni scalabili e con maggiore attenzione all’efficienza dei costi, e Gemini 3.8 Live Extended Thinking, progettato per richieste più complesse e ragionamento articolato su più passaggi; quest’ultima variante rimane al momento in private preview.
Il funzionamento di Live Avatar è multimodale: audio e informazioni visive vengono elaborati contemporaneamente e il modello può restituire in tempo quasi reale voce, video e testo, mantenendo l’interazione mentre continua a osservare ciò che accade attraverso una videocamera o una condivisione dello schermo. Il sistema supporta inoltre l’esecuzione asincrona degli strumenti, quindi può avviare tool call, interrogare servizi esterni e recuperare dati senza interrompere la conversazione con l’utente. In una dimostrazione, per esempio, l’avatar completa il check-in di un ospite in hotel mentre continua a parlare con la persona, eseguendo nel frattempo le operazioni necessarie sui sistemi di backend; in un altro scenario dedicato al settore assicurativo, un cliente mostra attraverso la videocamera i danni da segnalare, mentre l’agente compila il fascicolo della richiesta e un gruppo di agenti costruiti con Google Agent Development Kit verifica la polizza, applica le regole previste per l’apertura della pratica e prepara la documentazione per il perito. Il sistema comprende anche funzioni di recupero dalle interruzioni che mantengono sia il contesto della conversazione sia le transazioni avviate nel backend, comprensione diretta dei flussi video e delle schermate condivise, riconoscimento automatico della lingua e passaggio da una lingua all’altra senza necessità di selezioni manuali. Live Avatar può essere distribuito su applicazioni web, dispositivi mobili e chioschi interattivi e supporta conversazioni speech-to-speech in 97 lingue, modificando dinamicamente sincronizzazione labiale ed espressioni quando la lingua cambia anche nel corso della stessa conversazione. Google afferma che il passaggio tra lingue avviene senza compromettere la fedeltà del video e senza produrre progressivi disallineamenti visivi dell’avatar.
Le aziende possono scegliere un personaggio da una libreria di avatar preconfigurati oppure creare un avatar personalizzato partendo da un’immagine di riferimento ad alta qualità. In quest’ultimo caso il sistema genera una versione completamente animata e reattiva cercando di mantenere somiglianza con il riferimento originale, stile del marchio o identità del personaggio; la generazione di avatar personalizzati non è però disponibile automaticamente per tutti i clienti e richiede l’inserimento dell’organizzazione in una allowlist enterprise, accompagnato da procedure di verifica pensate per limitare l’uso improprio delle identità. Tutti i flussi audio e video prodotti dal sistema incorporano inoltre SynthID, il watermark impercettibile sviluppato da Google DeepMind per mantenere identificabili i contenuti generati dall’intelligenza artificiale anche quando il marchio non è percepibile durante la normale fruizione. Dal punto di vista tecnico, la model card di Gemini 3.8 Audio indica che i modelli sono basati su Gemini 3 Pro; Gemini 3.8 Live può ricevere audio, immagini, video e testo e dispone di una finestra di contesto fino a 128.000 token, mentre nelle configurazioni con Live Avatar produce audio, video e testo con un limite di output di 24.000 token. Gli avatar generano movimenti naturali della testa ed espressioni sincronizzate con il parlato sulla base dell’immagine configurata e degli input audio, ma la continuità delle sessioni video è al momento progettata per interazioni nell’ordine di alcuni minuti e non per conversazioni ininterrotte della durata di molte ore. La documentazione segnala inoltre limiti ancora presenti, tra cui possibili allucinazioni, occasionali rallentamenti o timeout e un knowledge cutoff fissato a gennaio 2025; nella propria valutazione di sicurezza sulle capacità di frontiera, Google non ha rilevato nuove capacità significative o incrementi prestazionali tali da far rientrare Gemini 3.8 Audio nei livelli Tracked o Critical Capability definiti dal Frontier Safety Framework dell’azienda.
Le prime implementazioni aziendali mostrano l’utilizzo di Live Avatar soprattutto in servizi nei quali conversazione, video e operazioni agentiche devono essere eseguiti contemporaneamente. Cox Automotive ha sviluppato per Autotrader un assistente allo shopping automobilistico che combina conversazione naturale, evidenziazione in tempo reale degli elementi visualizzati sullo schermo e chiamate a strumenti per accompagnare l’utente nella ricerca dei veicoli, nel confronto tra modelli e nelle opzioni di finanziamento. Equal AI utilizza invece sistemi di intelligenza artificiale che gestiscono complessivamente oltre un milione di chiamate live al giorno in nove lingue indiane e ha indicato tra i miglioramenti ottenuti con Gemini 3.8 Live una gestione più efficace delle interruzioni, delle conversazioni multilingue e dell’affidabilità delle tool call. Salesforce sta lavorando insieme a Google per integrare le capacità multimodali in tempo reale di Gemini 3.8 Live con Agentforce, combinando il dialogo audio-visivo con i flussi agentici della piattaforma, mentre Specs ha segnalato progressi nella Voice Activity Detection e nella riduzione della latenza per l’assistente AI utilizzato sulla propria piattaforma. Live Avatar estende quindi Gemini 3.8 Live aggiungendo alla conversazione nativa speech-to-speech uno strato video sincronizzato che può osservare l’utente, reagire visivamente, passare dinamicamente tra lingue diverse ed eseguire contemporaneamente attività sui sistemi aziendali senza sospendere il dialogo.
Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)