Contexte et objectifs
Google répond au problème de latence des agents vocaux en introduisant Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking. Les deux modèles sont présentés comme les plus avancés de la gamme Gemini Audio, capables de raisonner presque instantanément tout en continuant la conversation. Cette approche vise à éliminer les interruptions perceptibles lorsqu’un assistant doit consulter une source externe ou exécuter une tâche en arrière‑plan.
Architecture et fonctionnalités techniques
Les modèles combinent traitement du signal audio et raisonnement symbolique dans un même flux. Ils acceptent des appels d’API tierces pendant la génération de parole, ce qui permet d’interroger des bases de données, d’appeler des services cloud ou de manipuler des documents sans suspendre le dialogue. La prise en charge de la détection automatique de la langue et du basculement en cours de conversation couvre 97 langues, tandis que le « visual grounding » en temps réel associe des références visuelles aux réponses vocales. Les modèles reconnaissent les indices verbaux précoces (« let me check that ») pour acquiescer avant de fournir la réponse finale, améliorant ainsi la fluidité perçue.
Performances mesurées
Google cite plusieurs benchmarks : Gemini 3.8 Live Extended Thinking obtient 82,6 sur l’Artificial Analysis Speech‑to‑Speech Quality Index, dépassant GPT‑Live‑1‑Astra et Grok Voice Think Fast 2.0. Sur le Speech Agent Arena, le modèle Live se classe deuxième, tandis qu’il occupe la première place du benchmark EVA‑Bench de ServiceNow. Des scores supplémentaires incluent 68,6 % sur T‑Voice, 35,1 % sur T‑Voice‑banking et 97,7 % sur Big Bench Audio. Ces chiffres indiquent une amélioration notable de la clarté audio et de la pertinence contextuelle, mais la source ne fournit pas de marge d’erreur ni de comparaison directe avec les versions précédentes de Gemini.
Implications, limites et coûts
Le watermark SynthID intégré aux fichiers audio générés offre un moyen de traçabilité pour lutter contre la désinformation, bien que le mécanisme exact reste opaque. Le modèle Live est tarifé à 0,005 $ / minute d’entrée audio et 0,018 $ / minute de sortie, tandis que la version Extended Thinking ajoute des frais pour les tokens de raisonnement et les entrées multimodales (vidéo, documents). Ces coûts peuvent devenir significatifs dans des scénarios d’utilisation intensive, notamment pour les entreprises qui intègrent le modèle via les partenaires Vercel, Agora, LiveKit, Pipecat, Fishjam ou Vision Agents. Enfin, la capacité à exécuter des appels d’API en arrière‑plan soulève des questions de sécurité : chaque appel doit être correctement sandboxé pour éviter l’exécution de code non autorisé ou la fuite de données sensibles.