Présentation du modèle v4

ElevenLabs a dévoilé deux nouveaux modèles de synthèse vocale, v4 et v4 Turbo. Ils succèdent au v3 lancé l’an dernier et promettent un meilleur contrôle de l’expression ainsi qu’une prise en charge de plus de 90 langues, contre 70 précédemment. Le modèle v4 permet de cloner une voix à partir de seulement 10 secondes d’audio, ce qui réduit drastiquement le temps de collecte de données pour les applications d’agent vocal.

Architecture et mécanismes de contrôle d’expression

Le v4 repose sur une nouvelle architecture qui sépare le module de génération de texte du moteur de synthèse, ce qui facilite l’injection de balises d’expression en ligne. Les balises, introduites avec le v3, sont désormais extensibles : les utilisateurs peuvent empiler plusieurs balises et spécifier un ordre d’exécution, ce qui oblige le modèle à suivre la séquence d’instructions. Cette capacité à « stack » les tags améliore la cohérence des variations prosodiques sur de longs passages, car le modèle conserve le contexte lexical tout en adaptant le timbre et l’intonation selon les balises.

Performance multilingue et latence

ElevenLabs affirme que le v4 a atteint une amélioration notable de la qualité dans les langues japonaise, portugais brésilien, mandarin et cantonais. Le support de 90 langues repose sur un entraînement massif de données multilingues, mais la société ne précise pas le nombre exact d’heures d’audio utilisées. En termes de latence, le v4 Turbo réduit le délai de réponse, permettant au modèle de commencer à générer du son dès que le LLM sous‑jacent produit une réponse. Cette optimisation est cruciale pour les agents conversationnels où chaque milliseconde compte.

Implications commerciales et concurrence

Le modèle v4 s’inscrit dans la stratégie d’ElevenLabs visant à renforcer son activité d’appels d’entreprise, qui représente aujourd’hui plus de 55 % de son chiffre d’affaires. La société a levé 500 millions de dollars auprès de Sequoia, portant son évaluation à 11 milliards de dollars, avec des rumeurs de prochaine levée à 22 milliards. Le revenu annuel récurrent est passé de 330 millions à plus de 600 millions de dollars en moins d’un an, soutenu par une équipe de plus de 800 employés répartis entre l’Inde, l’Europe et le Brésil. Sur le plan concurrentiel, ElevenLabs affronte des startups comme Cartesia, Deepgram, Fish Audio, Boson et WellSaid Labs, ainsi que les géants Google et OpenAI qui ont récemment amélioré leurs propres modèles vocaux. La capacité du v4 à gérer les « confrontations, escalations et mises en attente » indique une orientation vers des cas d’usage plus complexes, où la fluidité de la conversation et la gestion d’émotions sont essentielles.