Contexte et besoin d’évaluation
Le Hub Hugging Face comptait plus de 8 000 modèles TTS le 30 septembre 2026, mais les procédures d’évaluation restaient fragmentées. Les classements existants, tels que TTS Arena v2 ou Voice Arena, reposent sur des votes humains et utilisent le modèle Bradley–Terry pour calculer un score Elo. Cette approche ne scale pas : la collecte de votes nécessite plusieurs semaines et ne garantit pas la cohérence des évaluateurs, comme le souligne le constat que seulement 16 modèles sur 92 de l’Arteficial Analysis sont en open‑weights.
Méthodologie et métriques objectives
L’Open TTS Leaderboard propose trois axes mesurés de façon automatisée. L’intelligibilité est évaluée par le taux d’erreur de mots (WER) et le taux d’erreur de caractères (CER) entre le texte d’entrée et la transcription obtenue via le modèle ASR Qwen3, classé premier du Open ASR Leaderboard. La vitesse est quantifiée par l’inverse du facteur temps réel (RTFx) pour l’inférence hors‑ligne en lot et par le time‑to‑first‑audio (TTFA) mesuré sur un GPU H200 (et sur CPU) avec un lot de taille 1. Enfin, la similarité du locuteur est calculée comme la similarité cosinus entre les embeddings WavLM du clip généré et la référence.
Résultats principaux et modèles leaders
Sur les ensembles anglais Seed TTS Eval et CV3 Eval, les modèles hexgrad/Kokoro‑82M, Supertone/supertonic‑3 et fishaudio/s2‑pro obtiennent les meilleurs WER moyens. En mode multilingue, les scores macro‑averagés montrent que k2‑fsa/OmniVoice, fishaudio/s2‑pro et FunAudioLLM/Fun‑CosyVoice3‑0.5B‑2512 offrent un compromis favorable entre WER, vitesse (RTFx) et taille du modèle, comme le visualisent les diagrammes de Pareto. L’activation du mode « voice cloning » améliore le WER de modèles tels que bosonai/higgs‑tts‑3‑4b et openbmb/VoxCPM2 lorsqu’un échantillon de référence est fourni, indiquant une meilleure préservation de l’identité vocale.
Analyse des limites et perspectives
Bien que les métriques automatisées accélèrent l’évaluation de quelques heures, elles ne remplacent pas les jugements humains. Le WER ne mesure pas la naturalité ou l’expression émotionnelle, et la similarité cosinus ne capture pas les nuances de prosodie. De plus, les mesures de vitesse sont réalisées sur un seul GPU H200 et un seul jeu de 50 prompts anglais, ce qui limite la généralisation aux configurations matérielles différentes. L’équipe invite donc la communauté à enrichir le tableau avec des votes humains et à proposer de nouveaux jeux de données afin d’affiner la pertinence des scores.