Présentation du nouveau Speech

Suno, connu pour son générateur musical basé sur l’IA, a lancé en octobre 2026 une version bêta publique de Speech. Le service, accessible depuis les interfaces web et mobiles de Suno, crée simultanément une voix synthétique et une bande‑son musicale à partir d’un texte ou d’une description libre. Deux modes sont proposés : Simple, où l’utilisateur saisit une consigne du type « un capitaine pirate motivant son équipage », et Avancé, qui accepte un script complet, le choix du genre vocal, le style de parole et le degré de variation. Un commutateur permet de désactiver la musique de fond pour ne conserver que la parole. La durée maximale d’un rendu est d’environ huit minutes.

Architecture et fonctionnement

Selon la communication de Suno, Speech constitue le « premier modèle audio qui génère voix et musique comme une piste cohérente ». Cette affirmation implique un réseau neuronal capable de synchroniser deux flux sonores distincts pendant la génération. Les modèles de texte‑à‑parole classiques, tels que ceux d’ElevenLabs ou d’Adobe, produisent d’abord la parole puis ajoutent éventuellement une musique en post‑production. Suno, en revanche, entraîne probablement un transformeur multimodal où les embeddings du texte sont projetés simultanément vers des espaces de représentation vocale et musicale, puis décodés conjointement. Une telle architecture réduit le risque de désynchronisation, mais augmente la complexité du processus d’apprentissage : le modèle doit maîtriser la prosodie tout en respectant les contraintes harmoniques de la musique d’accompagnement. Le fait que les accents britanniques « peuvent dériver vers l’Australie » indique que le corpus d’entraînement comporte des variations dialectales insuffisamment équilibrées, un problème fréquent lorsqu’on agrège des bases de données vocales hétérogènes.

Le choix d’une génération en une seule passe a des conséquences sur la latence. Les modèles de diffusion audio, souvent employés pour la synthèse musicale, sont plus lents que les transformeurs autoregressifs typiques des TTS. Suno n’a pas publié de métriques de temps de rendu, mais la limite de huit minutes suggère une optimisation pour des productions de courte à moyenne durée, compatibles avec les exigences de création de contenu rapide.

Analyse des impacts et limites

Le couplage voix‑musique ouvre des scénarios d’utilisation variés : poèmes narrés avec ambiance sonore, présentations éducatives, ou discours motivants soutenus par une trame rythmique. La possibilité de désactiver la musique conserve la flexibilité d’un TTS classique, ce qui rend le service adaptable à des environnements où le son de fond est indésirable. Cependant, la génération simultanée augmente le risque de contenus non autorisés, notamment la création de faux discours accompagnés d’une musique « authentique », ce qui pourrait compliquer les enquêtes de désinformation.

Sur le plan juridique, Suno a récemment fait face à plusieurs poursuites liées à son générateur musical. L’ajout de la fonction Speech pourrait être perçu comme une tentative de diversification pour atténuer ces pressions, mais il expose également la société à de nouvelles revendications de droits d’auteur si les voix synthétiques reproduisent des caractéristiques vocales protégées. Le mode bêta, explicitement indiqué comme « beta », laisse entendre que la qualité de la prononciation et la stabilité des accents restent variables, un point que Suno reconnaît dans son communiqué.

En résumé, Speech représente une avancée technique notable dans la fusion de la parole et de la musique par IA, mais son implémentation actuelle montre des limites liées à la diversité linguistique, à la latence et aux enjeux de propriété intellectuelle. Les retours des utilisateurs pendant la phase bêta seront déterminants pour affiner le modèle et définir les standards de qualité attendus dans ce type de génération audio conjointe.