Présentation

Google déploie aujourd’hui une expérience précoce sur le Pixel 11 qui confie à Gemini la prise en charge complète d’appels téléphoniques vers des commerces locaux. Le service, limité aux abonnés payants de Gemini inscrits au programme Phone by Google Public Beta aux États‑Unis, permet de réserver une table, vérifier la disponibilité d’un produit ou reprogrammer un rendez‑vous sans que l’utilisateur compose le numéro.

Fonctionnement technique

Lorsque l’utilisateur formule une requête du type « appelle le restaurant », l’application Gemini déclenche le module téléphonique du Pixel 11. Le dispositif utilise d’abord un moteur de synthèse vocale (TTS) pour se présenter au standard, puis un reconnaisseur automatique de la parole (ASR) afin d’interpréter les réponses vocales du commerce. Les informations extraites sont injectées dans le modèle de langage Gemini, qui génère en temps réel les réponses appropriées, que ce soit pour naviguer dans un menu automatisé ou pour répondre à un interlocuteur humain. Un transcript en direct s’affiche sur l’écran, offrant à l’utilisateur la possibilité d’intervenir à tout moment en appuyant sur un bouton de prise de contrôle.

Cette chaîne de traitement repose sur une intégration étroite entre le stack téléphonique Android, les API de reconnaissance et de synthèse vocales de Google, et le modèle Gemini hébergé dans le cloud. Le flux de données reste local tant que le texte n’est pas envoyé aux serveurs de Gemini, ce qui minimise la latence perçue lors des menus d’attente. Le système doit également gérer les musique d’attente et les réponses ambiguës, ce qui impose des exigences élevées en matière de robustesse de l’ASR et de capacité de maintien du contexte conversationnel sur plusieurs tours.

Implications et limites

Le principal avantage réside dans la réduction du temps d’attente perçu, mais la fonctionnalité comporte plusieurs contraintes. D’abord, l’accès est géographiquement restreint aux États‑Unis et dépend du modèle Pixel 11, excluant ainsi la majorité des utilisateurs Android. Ensuite, le service ne s’applique qu’aux appels « locaux » et à des scénarios simples ; les négociations complexes ou les interactions nécessitant une identification forte restent hors de portée.

Sur le plan de la confidentialité, chaque échange vocal est transmis aux serveurs de Gemini pour le traitement du langage, ce qui soulève des questions de conformité au RGPD et aux législations locales sur la protection des données. Google indique que l’utilisateur conserve le contrôle grâce au transcript et à la possibilité de reprendre la conversation, mais aucune information précise n’est fournie sur la durée de conservation des enregistrements ni sur les mécanismes de chiffrement utilisés.

Enfin, la comparaison avec le projet « Call for me » lancé l’an dernier montre une évolution notable : la prise de contrôle en temps réel était absente auparavant, mais elle introduit une nouvelle surface d’attaque potentielle si un acteur malveillant parvient à usurper le canal de prise de contrôle. Meta travaille sur une fonctionnalité similaire avec Muse AI, où des opérateurs humains pourraient intervenir, ce qui indique que l’industrie explore encore les meilleures pratiques pour concilier automatisation et supervision humaine.