Performance sur le benchmark
Selon les mesures publiées par Coval au 14 septembre 2026, le modèle Qwen3‑ASR Fast atteint un temps moyen de Time‑to‑Final‑Segment (TTFS) de 44 ms (p50) et un Word Error Rate (WER) de 3,6 %. Ce score le place premier en latence et deuxième en précision, derrière uniquement AssemblyAI Universal 3.5 Pro (WER 3,5 %). En synthèse vocale, Qwen3‑TTS Fast se classe deuxième en Time‑to‑First‑Audio (TTFA) avec 63 ms (p50) et obtient le WER le plus bas du benchmark, 3,8 %. Le seul modèle plus rapide (49 ms) possède 300 M de paramètres, contre les 1,7 B de Qwen3‑TTS, ce qui souligne l’efficacité du modèle de Nari Labs.
Analyse des métriques de latence et de qualité
Le TTFA et le TTFS mesurent respectivement le délai entre l’entrée texte et le premier fragment audio, et entre la requête utilisateur et le texte final. Des valeurs de l’ordre de quelques dizaines de millisecondes sont critiques pour les agents vocaux, car elles évitent la perception d’un « gel » de l’interaction. Le WER, quant à lui, quantifie les erreurs de transcription ou de génération ; un WER inférieur à 4 % indique une compréhension ou une production quasi‑humaine sur les jeux de données agrégés. Le fait que Qwen3‑TTS conserve un WER de 3,8 % tout en restant parmi les modèles les plus rapides montre que l’architecture ne sacrifie pas la précision au profit de la vitesse.
Coût et compétitivité
Sur le plan économique, le point d’accès Fast de Qwen3‑ASR est facturé à 0,12 $ / heure, ce qui le place à égalité pour le deuxième tarif le plus bas parmi les modèles publics répertoriés par Coval. L’alternative Standard serait encore moins chère à 0,06 $ / heure. En synthèse, le modèle Fast de Qwen3‑TTS coûte 10 $ / million de caractères, partageant la première place du répertoire de prix, tandis que le modèle Standard serait à 5 $ / million. Les concurrents majeurs (ElevenLabs, Cartesia) affichent des coûts 5 à 6,5 fois supérieurs pour des performances similaires ou inférieures.
Implications pour les applications vocales
Ces résultats placent Nari Labs comme fournisseur capable d’offrir à la fois latence ultra‑faible, haute précision et tarif compétitif. Les développeurs d’assistants vocaux peuvent ainsi réduire le budget d’inférence tout en maintenant une expérience utilisateur réactive. La différence de paramètres (300 M vs 1,7 B) montre que l’optimisation logicielle et le déploiement efficace (Fast vs Standard) sont des leviers majeurs, au-delà de la simple taille du modèle. Enfin, la disponibilité d’un crédit de 20 $ lors du passage en version générale (GA) facilite les essais en production, accélérant l’adoption de ces modèles dans des scénarios à forte exigence de réactivité.