Immagine AI

NVIDIA ha rilasciato Nemotron 3 Diarization, un modello open-weight per la speaker diarization progettato per determinare chi parla e in quale momento all’interno di un flusso audio, sia in tempo reale sia su registrazioni già disponibili. Il modello può identificare fino a otto interlocutori distinti, assegnando a ciascun segmento temporale un’etichetta coerente e fornendo una traccia precisa dell’attività vocale dei diversi speaker; se abbinato a un sistema di riconoscimento vocale, consente inoltre di attribuire le parole trascritte alla persona che le ha pronunciate. Nemotron 3 Diarization adotta un’architettura end-to-end che evita la tradizionale pipeline composta da segmentazione, estrazione di speaker embedding e clustering, sostituendola con un unico passaggio di inferenza. Il modello è costituito da un encoder Transformer a 31 strati con circa 100 milioni di parametri e Rotary Positional Embeddings. L’audio in ingresso deve essere mono a 16 kHz e viene convertito in frame di mel-spettrogramma da 10 millisecondi; questi vengono successivamente ridotti di un fattore otto fino a una frequenza interna di 80 millisecondi per frame dell’encoder, mentre uno strato Conv1D riporta poi le predizioni alla risoluzione temporale originale di 10 millisecondi. L’output consiste in un tensore di probabilità di attività con forma T × 8, nel quale gli otto canali corrispondono agli speaker ordinati in base al momento in cui compaiono per la prima volta nella registrazione. In questo modo la prima voce rilevata mantiene la stessa identità anche nei segmenti successivi, caratteristica essenziale nelle conversazioni lunghe e nei sistemi che devono elaborare audio in streaming.

Per il funzionamento in tempo reale, Nemotron 3 Diarization utilizza l’Arrival-Order Speaker Cache e una coda FIFO derivate dal precedente lavoro NVIDIA Streaming Sortformer. La cache conserva le informazioni relative agli speaker già incontrati nei blocchi precedenti, mentre la coda mantiene il contesto dei frame più recenti necessario alla fase successiva di inferenza; questo consente al modello di preservare l’identità degli interlocutori senza eseguire nuovamente operazioni di clustering a ogni segmento. L’inferenza a blocchi non impone inoltre un limite fisso alla durata complessiva dell’audio. Un singolo checkpoint supporta quattro profili consigliati: buffer da 0,32, 0,64 e 1,04 secondi per lo streaming e un profilo offline da 30,4 secondi. La latenza indicata si riferisce al solo input buffer, calcolato sulla somma tra dimensione del chunk e right context moltiplicata per gli 80 millisecondi del frame interno, e non comprende quindi il tempo computazionale necessario all’elaborazione. Tecnicamente il checkpoint può scendere fino a un buffer di 80 millisecondi, anche se 0,32 secondi rappresenta il valore minimo raccomandato, mentre la risoluzione dei frame di output può essere configurata in multipli di 10 millisecondi. Questa flessibilità permette di scegliere tra maggiore accuratezza e risposta più rapida a seconda dello scenario, passando da analisi offline di riunioni registrate a interazioni vocali live nelle quali la rilevazione del cambio di interlocutore deve avvenire in poche centinaia di millisecondi.

Nei benchmark pubblicati, il nuovo modello mostra miglioramenti consistenti rispetto a diar_streaming_sortformer_4spk-v2.1, con valutazioni che includono anche il parlato sovrapposto. Su DIHARD III il diarization error rate è pari a 12,73 nel profilo da 30,4 secondi e 13,55 a 0,32 secondi, contro rispettivamente 19,09 e 19,85 del modello precedente. Sul dataset NOTSOFAR1 single-channel il valore riportato nel profilo offline è 11,00 contro 30,49, su AMI Test SDM 11,14 contro 21,42, su AliMeeting Test Near 6,40 contro 11,57 e su CALLHOME-Part2 9,10 contro 10,32. Per AMI, AliMeeting e NOTSOFAR1 i risultati sono stati calcolati utilizzando reference label basate su forced alignment, per cui NVIDIA specifica che non devono essere confrontati direttamente con valutazioni ottenute attraverso annotazioni di riferimento differenti. Anche sul piano prestazionale vengono riportati valori elevati: su RTX PRO 5000 in precisione BF16, con batch size 1 e profilo offline, il rapporto tra durata dell’audio e tempo totale di elaborazione raggiunge un real-time-factor speedup di 1.340 in modalità eager e 4.385 in modalità compilata; nel profilo da 0,32 secondi i valori scendono rispettivamente a 12,5 e 54, coerentemente con il maggiore costo della lavorazione a latenza molto bassa. Baseten ha effettuato valutazioni indipendenti riportando un error rate del 9,8% su AISHELL-4 nel profilo low-latency, contro il 27,2% di Streaming Sortformer v2.1, e segnala che il passaggio dal profilo offline da circa 30 secondi a quello ultra-low-latency da 0,32 secondi comporta un aumento dell’errore limitato a circa uno o due punti. Nei test Baseten il modello ha inoltre superato Meta Muse Voice Transcribe su tutti i dataset esaminati e ha registrato prestazioni inferiori a pyannote community-1 soltanto su AMI.

Il training ha combinato circa 10.000 ore di conversazioni reali con 82.611 ore di miscele multi-speaker sintetiche. I dati reali comprendono Fisher English, i corpus di meeting AMI e ICSI, VoxConverse, AISHELL-4, AliMeeting, DIHARD III, CALLHOME, NOTSOFAR1, i dataset DISPLACE, registrazioni David AI con licenza e una porzione pseudo-etichettata di YODAS-v2. Le miscele sintetiche sono state prodotte attraverso il toolkit FastMSS partendo da circa 28.000 ore di registrazioni con un solo interlocutore. L’addestramento è stato inizializzato da un checkpoint self-supervised NEST ed eseguito su otto nodi, ciascuno dotato di otto GPU NVIDIA A100 da 80 GB, in due fasi distinte: prima un training offline sui dati simulati e successivamente un fine-tuning per lo streaming utilizzando una combinazione di audio reale e sintetico. L’utilizzo del modello è regolato dalla OpenMDW License Agreement 1.1 ed è previsto sia per applicazioni commerciali sia non commerciali. Nemotron 3 Diarization è disponibile su Hugging Face nel repository nvidia/Nemotron-3-Diarization e può essere utilizzato attraverso NeMo Framework 3.0 sulle GPU NVIDIA basate sulle architetture Ampere, Ada Lovelace, Hopper e Blackwell.

Baseten ha reso disponibili contestualmente tre preset di serving, ciascuno eseguito su una singola RTX PRO 6000 attraverso un motore basato su CUDA Graph e sul loop streaming di NVIDIA NeMo. Batch Diarization utilizza un endpoint HTTP per elaborare audio registrato e restituisce i turni degli speaker adottando il profilo di latenza selezionato per la richiesta; Streaming Diarization usa invece WebSocket per ricevere audio live e mantenere l’identità degli interlocutori lungo tutta la conversazione senza effettuare reclustering. Il terzo preset, Streaming Diarized Transcription, combina Nemotron 3 Diarization con Parakeet V2, il modello NVIDIA per il riconoscimento vocale da 600 milioni di parametri, producendo parole associate ai singoli speaker con timestamp, risultati parziali specifici per interlocutore e flag per il parlato sovrapposto. In questa configurazione i vettori di attività per speaker vengono forniti direttamente ai primi strati encoder di Parakeet, permettendo al sistema di trascrivere anche sovrapposizioni vocali in un unico passaggio; le etichette speaker vengono considerate definitive al momento della loro emissione e le parole già confermate non vengono successivamente riscritte. Secondo i dati Baseten, una singola RTX PRO 6000 può sostenere oltre 500 flussi simultanei della durata di un’ora con il profilo da 1,04 secondi, circa 200 flussi nel profilo da 0,32 secondi e 190 flussi quando viene aggiunta anche la trascrizione, mentre il preset batch può elaborare 200 file audio da sei minuti ogni minuto. Utilizzando gli stessi file e lo stesso hardware, il preset ottimizzato da Baseten avrebbe inoltre raggiunto circa 1,35 volte il throughput batch della configurazione NVIDIA di riferimento. Il segnale di attività prodotto ogni 10 millisecondi può infine essere riutilizzato per voice activity detection, rilevamento della fine del turno per singolo speaker, gestione delle interruzioni e turn-taking in agenti vocali, con tempi di risposta che possono scendere a circa 300 millisecondi nelle configurazioni a latenza ultra-bassa.

Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)

Di Fantasy