ElevenLabs ha lanciato Eleven v4, una nuova generazione del proprio modello text-to-speech progettata per migliorare soprattutto espressività, naturalezza e capacità di interpretare il contesto del testo, affiancandola a Eleven v4 Turbo, variante ottimizzata per applicazioni in tempo reale come agenti vocali e conversazioni interattive. Entrambi i modelli sono già disponibili attraverso ElevenAgents, ElevenCreative ed ElevenAPI e possono essere utilizzati anche dagli account gratuiti. Eleven v4 utilizza un’architettura completamente nuova che analizza non soltanto le parole da pronunciare, ma anche tono, ritmo, emozione, caratteristiche del personaggio e contesto della scena, in modo da produrre una voce che possa risultare, a seconda delle istruzioni e del contenuto, drammatica, delicata, urgente, comica oppure semplicemente conversazionale senza perdere l’identità del parlante. ElevenLabs dichiara inoltre un miglioramento generale della fedeltà audio rispetto alle generazioni precedenti e ha introdotto un nuovo sistema per rappresentare l’identità del parlante, pensato per mantenere una voce coerente quando viene utilizzata in applicazioni molto differenti, dalle conversazioni con agenti AI agli audiolibri e alla pubblicità. Anche il contesto viene gestito a livello di scena: durante un dialogo ogni intervento può quindi tenere conto di ciò che è stato pronunciato immediatamente prima, anziché essere generato come una sequenza di frasi indipendenti, con l’obiettivo di rendere più naturale l’alternanza tra i diversi interlocutori.
Una delle principali modifiche riguarda il controllo della recitazione e degli elementi sonori, che in Eleven v4 passa soprattutto attraverso istruzioni formulate in linguaggio naturale e tag audio inseriti direttamente nel testo. Il modello può essere guidato con indicazioni relative alla modalità con cui deve essere pronunciata una frase oppure con comandi destinati a introdurre eventi sonori e comportamenti vocali, come una risata, un’espressione pronunciata con rabbia e con un determinato accento, il rumore della pioggia leggera o la vibrazione di un telefono. Secondo ElevenLabs, il nuovo modello segue queste indicazioni con maggiore precisione rispetto alle generazioni precedenti e migliora anche il supporto ai fonemi dell’International Phonetic Alphabet, permettendo di impostare pronunce personalizzate in maniera più affidabile. Cambia di conseguenza anche il metodo utilizzato per controllare pause e prosodia: in Eleven v4 i tradizionali tag SSML come <break> non sono abilitati e vengono sostituiti dalle istruzioni naturali e dai nuovi audio tag. Questa impostazione permette di trattare la generazione vocale in modo più simile alla direzione di un interprete, descrivendo nel testo il comportamento desiderato invece di controllare esclusivamente la sintesi tramite marcatori tecnici.
Per le applicazioni che richiedono risposte immediate, ElevenLabs ha sviluppato parallelamente Eleven v4 Turbo e lo ha ottimizzato insieme alla piattaforma conversazionale ElevenAgents come un unico sistema. Turbo supporta lo streaming bidirezionale, consentendo al modello di iniziare a restituire l’audio prima ancora che l’intera frase sia stata completata, caratteristica particolarmente importante per agenti vocali, assistenza telefonica e altri servizi nei quali anche poche centinaia di millisecondi possono rendere percepibile una pausa artificiale nella conversazione. Nei test effettuati da ElevenLabs nel settembre 2026 tramite streaming WebSocket, utilizzando gli stessi script e le impostazioni predefinite per tutti i sistemi confrontati e sottraendo la latenza della rete, Eleven v4 Turbo ha registrato un tempo mediano fino all’inizio del parlato di circa 150 millisecondi. La stessa comparazione riporta 262 millisecondi per Cartesia Sonic 3.6 e 814 millisecondi per OpenAI GPT-4o mini TTS, mentre nei test erano presenti anche xAI TTS e Google Gemini Flash-Lite TTS. Separatamente, ElevenLabs indica per Turbo una latenza mediana di inferenza di circa 100 millisecondi, valore che la società confronta con la pausa media che normalmente intercorre tra gli interventi di due persone durante una conversazione. È importante distinguere i due dati: i circa 100 millisecondi riguardano l’elaborazione del modello, mentre i circa 150 millisecondi rappresentano il tempo misurato fino alla produzione del primo parlato nelle condizioni del benchmark descritto dall’azienda.
Eleven v4 ed Eleven v4 Turbo supportano più di 90 lingue e introducono modifiche anche nella gestione degli accenti quando una voce viene utilizzata in una lingua diversa da quella nella quale è stata originariamente registrata. ElevenLabs afferma che una voce acquisita in una determinata lingua può ora parlare fluentemente nelle altre lingue supportate adottando l’accento corrispondente a un parlante nativo e mantenendolo durante l’intera generazione, evitando la progressiva tendenza a ritornare verso l’accento della registrazione originale che poteva comparire nei sistemi precedenti. È stata aggiornata anche la clonazione vocale: gli Instant Voice Clone possono ricostruire una voce a partire da circa dieci secondi di registrazione e, secondo i test interni dell’azienda, raggiungono con Eleven v4 una qualità superiore anche ai Professional Voice Clone utilizzati con Multilingual v2. Ritornano inoltre i Professional Voice Clone, che non erano disponibili con Eleven v3, e possono ora sfruttare l’intera gamma espressiva del nuovo modello. Per entrambe le modalità di clonazione ElevenLabs richiede il consenso verificato del proprietario della voce, mentre l’audio prodotto rimane identificabile attraverso AI Speech Classifier, il sistema sviluppato dall’azienda per rilevare contenuti vocali generati artificialmente.
La nuova architettura interviene anche sulla produzione di contenuti audio lunghi. ElevenLabs ha migliorato il cosiddetto request stitching, cioè il collegamento di più generazioni consecutive necessario quando un testo supera la quantità elaborabile in un’unica richiesta. Una singola generazione con Eleven v4 può contenere fino a 10.000 caratteri, mentre il context stitching permette di concatenare segmenti successivi preservando in maniera più stabile ritmo, interpretazione e caratteristiche vocali lungo uno script esteso. Il miglioramento è destinato in particolare agli utilizzi in ElevenLabs Studio e nell’applicazione ElevenLabs Reader, dove audiolibri, articoli, produzioni editoriali e altri contenuti possono richiedere una continuità vocale molto superiore alla lunghezza gestibile da una singola generazione. La gestione del contesto e dell’identità vocale serve quindi anche a evitare che lo stesso speaker cambi progressivamente velocità, intonazione o stile quando un contenuto viene suddiviso tecnicamente in più richieste.
Nei benchmark comunicati dall’azienda, Eleven v4 ha raggiunto nel settembre 2026 il primo posto nell’Artificial Analysis Provider Voice Arena Leaderboard e, nei test d’ascolto alla cieca condotti da ElevenLabs, è stato preferito complessivamente da circa il 75% degli ascoltatori. La metodologia utilizzata prevedeva confronti diretti con Cartesia Sonic 3.6, Inworld TTS-2, Google Gemini 3.8 Flash-Lite TTS e Google Gemini 3.8 Flash TTS: ai valutatori veniva fatta ascoltare la stessa frase generata da Eleven v4 e da uno dei modelli concorrenti senza indicare quale sistema avesse prodotto ciascuna versione, chiedendo quindi quale risultasse più espressiva e quale più naturale; i pareggi venivano conteggiati come metà vittoria per ciascun modello. Nei singoli confronti mostrati dall’azienda, Eleven v4 ha ottenuto percentuali di preferenza comprese tra il 65% e l’81%. Si tratta quindi di benchmark e test d’ascolto riportati direttamente da ElevenLabs, effettuati con la metodologia specificata dalla società, più utili per confrontare le condizioni dichiarate della prova che come misura assoluta della qualità percepibile in ogni possibile applicazione.
Dal punto di vista dell’integrazione, entrambi i modelli sono accessibili mediante API REST e streaming e dispongono di SDK per TypeScript e Python; il passaggio da un modello all’altro viene effettuato modificando il relativo model_id. I formati di uscita rimangono compatibili con quelli disponibili negli altri sistemi ElevenLabs e comprendono MP3, WAV/PCM non compresso per produzione audio, studio e post-produzione e µ-law per applicazioni telefoniche e call center, con bitrate e frequenza di campionamento configurabili attraverso l’API. Tutte le oltre 17.500 voci presenti nella libreria ElevenLabs possono essere utilizzate con Eleven v4, mentre gli Instant Voice Clone e i Professional Voice Clone creati prima del lancio devono essere nuovamente addestrati per funzionare in maniera efficace con il nuovo modello. La struttura commerciale rimane quella basata sui crediti utilizzata dagli altri servizi text-to-speech dell’azienda: il piano gratuito include 10.000 crediti al mese, equivalenti secondo ElevenLabs a circa dieci minuti di audio, mentre i piani a pagamento partono da 6 dollari al mese e comprendono anche la clonazione vocale professionale; per le aziende sono disponibili condizioni personalizzate.
ElevenLabs indica infine che Eleven v4 viene eseguito su un’infrastruttura certificata SOC 2 Type II, ISO 27001 e PCI DSS Level 1, conforme al GDPR e utilizzabile in workflow sanitari compatibili con i requisiti HIPAA. La società dichiara di non utilizzare script o audio tag dei clienti per l’addestramento senza consenso e mette a disposizione, per i servizi enterprise idonei, una modalità Zero Retention che evita la conservazione dei dati secondo le condizioni previste dal servizio. Eleven v4 e la variante Turbo vengono quindi introdotti come due configurazioni della stessa nuova generazione tecnologica destinate a esigenze differenti: il modello principale privilegia qualità, controllo dell’interpretazione, fedeltà della voce e produzione espressiva, mentre Turbo utilizza la stessa evoluzione architetturale puntando soprattutto alla velocità necessaria per agenti vocali e applicazioni interattive, nelle quali la generazione deve iniziare mentre la conversazione è ancora in corso anziché dopo la preparazione completa di ogni risposta.
Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)
