Contexte et objectifs

Synthesia, startup britannique valorisée à 4 milliards de dollars et affichant plus de 100 millions de dollars de revenu récurrent annuel, développe des avatars vidéo alimentés par l’IA. En 2026, l’entreprise a présenté Roleplay Sessions, un service où les employés s’entraînent face à un avatar capable de répondre et d’évaluer leurs performances. Dans ce cadre, le journaliste Dominic‑Madori Davis a demandé la création d’un avatar personnel afin d’expérimenter la technologie sur un sujet précis : son article sur la fraude dans les startups financées par du capital‑risque.

Le projet a abouti à quatre modèles : deux avatars « personnels » qui lisent un script fourni, et deux avatars « interactifs » capables de comprendre la parole et de répondre de façon déterministe. Tous les modèles ont été générés en quelques jours dans le studio vidéo de Synthesia à New York, après la capture de plusieurs dizaines de photos et d’un enregistrement vocal de deux minutes.

Architecture technique de l'avatar interactif

L’enchaînement de modèles repose sur quatre blocs distincts. Un modèle de reconnaissance vocale (voice‑to‑text) transforme la question de l’utilisateur en texte. Un modèle de langage « agentic » analyse ce texte, le compare à la base d’entraînement (l’article sur la fraude) et génère une réponse textuelle. Cette réponse est ensuite convertie en audio par un modèle de synthèse vocale (text‑to‑voice) ; Synthesia propose ses propres modèles mais autorise également des alternatives comme Cartesia, ElevenLabs, Google ou OpenAI. Enfin, un modèle vidéo propriétaire anime le visage de l’avatar en synchronisant les mouvements labiaux avec le flux audio.

Le pipeline est configurable : les clients peuvent choisir le fournisseur de modèle vocal, le cloud d’hébergement (AWS, Azure, GCP ou infrastructure interne) et même combiner les API via la plateforme API de Synthesia. Cette modularité permet d’ajuster la latence et le coût selon les exigences de l’entreprise, tout en conservant la même interface utilisateur.

Analyse des performances, limites et perspectives journalistiques

Le comportement déterministe de l’avatar signifie qu’il ne répond qu’aux questions couvertes par le texte d’entraînement ; toute requête hors sujet est redirigée vers le même article. Cette contrainte garantit la cohérence mais limite l’utilité pour des dialogues ouverts. Les retours des proches du journaliste indiquent que la synthèse vocale reproduit correctement le timbre, mais que la correspondance visuelle reste approximative, surtout lorsqu’il porte des lunettes. Le processus de création, bien que rapide, dépend d’une collecte de données consentie et d’une modélisation fine du visage, soulevant des questions de confidentialité et de droit à l’image.

Sur le plan journalistique, l’expérience montre que les avatars peuvent servir de présentateurs automatisés pour des contenus pré‑définis, mais qu’ils ne remplacent pas la capacité humaine à improviser ou à traiter des informations inédites. L’adoption à grande échelle nécessitera des mécanismes de contrôle de la désinformation, ainsi que des évaluations de biais introduits par les modèles de langage et de synthèse vocale.