Contexte et enjeux
Nuance Labs, start‑up basée à Seattle, a annoncé la clôture d’une levée de fonds de 50 millions de dollars en série A. Le tour a été mené par Lightspeed Venture Partners, avec la participation récurrente d’Accel et de South Park Commons, ainsi que de nouveaux investisseurs Nvidia Corp. et Define Ventures. Le capital est destiné à accélérer le développement d’un modèle d’avatar IA capable de dialoguer en temps réel, sans les délais observés sur les solutions actuelles.
Le co‑fondateur et CEO, Fangchang Ma, ancien chercheur en IA chez Apple, décrit le problème comme une « chaîne de traitements » où chaque composant – reconnaissance vocale, modèle de langage, synthèse vocale et animation faciale – opère séquentiellement. Cette architecture entraîne des temps d’attente perceptibles, surtout lorsqu’une quatrième étape d’animation faciale est ajoutée.
Architecture du modèle full‑duplex
Nuance Labs propose un système « full‑duplex » qui accepte simultanément un flux audio‑vidéo entrant et produit un flux audio‑vidéo sortant. Le modèle intègre la perception de mots, regard, gestes, ton et synchronisation et génère en temps réel des réponses vocales et des expressions faciales. En consolidant les quatre fonctions classiques en un seul réseau, la latence de traitement est réduite, car aucune conversion intermédiaire n’est requise.
Techniquement, le réseau combine un encodeur multimodal capable d’extraire des caractéristiques synchronisées de la parole et de la vidéo, suivi d’un décodeur qui prédit simultanément le texte de réponse, la prosodie et les paramètres d’animation faciale. L’apprentissage continu se base sur des dialogues enregistrés, où le modèle ajuste ses poids pour mieux refléter les comportements humains observés.
Analyse des performances et limites
Le prototype présenté par Nuance Labs montre que le système réagit aux indices non verbaux pendant que l’interlocuteur parle, contrairement aux avatars traditionnels qui restent figés jusqu’à la fin de la phrase. Cette capacité à « interrompre » le flux d’entrée et à répondre en continu représente une avancée mesurable, même si les métriques de latence exacte n’ont pas été publiées. Le manque de données chiffrées empêche une comparaison précise avec les solutions concurrentes, mais la réduction du nombre d’étapes de traitement suggère une amélioration de l’ordre de plusieurs dizaines de millisecondes.
Un risque identifié réside dans la complexité du modèle unique : la convergence d’un grand nombre de tâches (reconnaissance, génération, animation) peut rendre le processus d’entraînement plus sensible aux biais de données et aux sur‑ajustements. De plus, la nécessité d’une bande passante élevée pour le flux vidéo bidirectionnel peut limiter l’adoption sur des réseaux à faible débit.
Perspectives et financement
Nuance Labs prévoit de publier une première version de recherche d’ici la fin de l’année, ciblant des scénarios tels que la vente, le service client, le coaching, la formation professionnelle et l’apprentissage des langues. Le financement de 50 M$ servira à étendre l’équipe de recherche et à affiner le modèle pour des déploiements à grande échelle. Si le modèle atteint les performances attendues, il pourrait devenir une couche sous‑jacente pour de nombreuses applications IA nécessitant une interaction visuelle fluide.