Présentation
Nemotron 3 Diarization est un modèle ouvert de 100 M paramètres dédié à la diarisation, c’est‑à‑dire à l’identification du locuteur actif dans un flux audio. Il occupe la première place du classement VoiceArena Diarization‑Bench avec un taux d’erreur de diarisation (DER) de 14,72 %. Le modèle supporte jusqu’à huit locuteurs simultanés, gère le chevauchement vocal et fonctionne tant en mode hors‑ligne qu’en streaming, avec une latence de 1,04 s pour un débit de traitement compatible temps réel.
Fonctionnement technique
Le pipeline débute par un signal mono à 16 kHz transformé en spectrogrammes de Mel à pas de 10 ms. Ces caractéristiques sont empilées par un facteur de huit, produisant des trames de 80 ms qui alimentent un encodeur Transformer de 31 couches doté d’embeddings positionnels rotatifs (RoPE). Au‑dessus du Transformer, une couche Conv1D up‑sample les prédictions à la résolution d’entrée. La sortie est un tenseur [T, 8] de probabilités, T représentant les pas de temps (par défaut 10 ms) et 8 les canaux de locuteur. Cette représentation autorise naturellement le chevauchement : plusieurs canaux peuvent être actifs simultanément.
En streaming, deux mécanismes de mémoire assurent la cohérence entre les blocs audio. Le Arrival‑Order Speaker Cache (AOSC) conserve les informations des locuteurs déjà rencontrés, classés selon leur ordre d’apparition. Un contexte FIFO fournit un historique temporel limité, garantissant que le même locuteur conserve son identifiant d’un segment à l’autre sans recombinaison de permutation.
Performances et limites
Sur le benchmark VoiceArena, Nemotron 3 Diarization réalise une réduction relative de 40 % du DER par rapport aux modèles précédents, tout en maintenant une latence de 1,04 s. L’ajout de données licenciées par David AI a permis de diminuer le DER de 0,77 point absolu, passant de 11,19 % à 10,42 % aux deux points d’opération (offline et ultra‑faible latence). Cependant, le modèle ne fournit que des étiquettes anonymes (speaker_1, speaker_2, …) et ne réalise pas d’identification d’identité réelle ; l’association à des profils utilisateurs doit être effectuée en aval.
Le modèle reste limité à huit canaux ; au‑delà, la précision chute et la charge mémoire augmente. De plus, la dépendance à des données publiques et licenciées implique que les performances peuvent varier selon la langue ou l’accent, même si les entraînements couvrent 21 langues.
Déploiement et perspectives
Nemotron 3 Diarization s’intègre via le framework NVIDIA NeMo Speech, disponible sur Hugging Face. Les développeurs peuvent choisir entre une exécution hors‑ligne sur des enregistrements ou un flux continu en configurant le point d’équilibre latence‑qualité. Le modèle accepte des entrées de 16 kHz, mais aucune optimisation spécifique n’est mentionnée pour le traitement sur appareil mobile, ce qui pourrait limiter les scénarios d’utilisation embarquées. Les futures améliorations pourraient viser l’extension du nombre de locuteurs, la réduction de la latence en dessous de 500 ms et l’ajout d’une couche d’identification de locuteur afin de fournir directement des identités vérifiées.