Alibaba ha presentato Qwen-Audio 3.0 ASR Flash, un nuovo modello di riconoscimento automatico del parlato progettato per trascrivere audio di lunga durata mantenendo coerente il contesto. Il modello è disponibile tramite API sulla piattaforma Alibaba Cloud BaiLian e può essere utilizzato per riunioni, lezioni, interviste, assistenza clienti e applicazioni specialistiche nei settori medico, industriale e informatico. Durante l’elaborazione di registrazioni che durano diverse ore, Qwen-Audio 3.0 ASR Flash conserva le informazioni emerse nelle parti precedenti dell’audio. Questa capacità consente di riportare in modo uniforme nomi di persone, termini tecnici e riferimenti ricorrenti, riducendo le discontinuità che possono comparire quando una registrazione viene trascritta per segmenti indipendenti.
Il modello è stato addestrato per riconoscere termini rari e specialistici senza richiedere la configurazione preventiva di un dizionario dedicato. Nei test interni di Alibaba ha raggiunto un tasso di richiamo del 95,36% per la terminologia medica, del 93,24% per quella industriale e del 91,87% per i termini relativi alla programmazione e all’informatica.
Per gli ambienti aziendali è disponibile la funzione Custom Hotwords, che permette di registrare nomi di società, prodotti, marchi e vocaboli interni. Le parole aggiunte vengono applicate immediatamente al riconoscimento vocale e, secondo Alibaba, raggiungono nella maggior parte dei contesti un tasso di richiamo superiore al 99%. Il sistema è stato inoltre sviluppato per evitare che l’aumento del numero di parole personalizzate provochi una crescita significativa dei falsi riconoscimenti.
Qwen-Audio 3.0 ASR Flash può trasformare automaticamente la trascrizione grezza in un testo più leggibile. Il modello elimina intercalari e riempitivi, riduce le ripetizioni, sistema le frasi corrette durante il discorso e riorganizza il contenuto in base al contesto. Può quindi produrre verbali di riunioni e trascrizioni di interviste già strutturati, limitando le operazioni manuali di revisione successive.
Il supporto linguistico comprende oltre 30 lingue attraverso un unico modello. Nelle valutazioni condotte su sette lingue principali, Alibaba ha rilevato un tasso medio di errore semantico del 17,09%, indicando tra gli impieghi previsti anche la trascrizione di conferenze internazionali e la gestione dell’assistenza clienti multilingue.
Insieme alla versione Flash, Alibaba ha distribuito Qwen-Audio 3.0 ASR Streaming, destinato alle applicazioni in tempo reale. Il modello può produrre sottotitoli e trascrizioni con una latenza teorica di circa 300 millisecondi. Nei test relativi agli ambienti industriali ha registrato un tasso di errore dei caratteri del 7,80% in cinese e dell’11,52% in inglese.
