Présentation

Google a annoncé que le modèle de langage Gemini est désormais disponible dans l’application Téléphone des appareils Pixel. La fonction permet à l’utilisateur de dicter une requête du type « appeler Marie » et de laisser l’assistant exécuter l’appel, gérer la conversation et, le cas échéant, résumer le contenu. L’annonce s’inscrit dans la suite d’améliorations de l’IA conversationnelle déployées sur les smartphones Pixel les plus récents.

Fonctionnement technique

Lorsque l’utilisateur active la commande vocale, le dispositif envoie la requête audio aux serveurs de Gemini via une connexion sécurisée. Le modèle analyse l’intention, identifie le contact dans le répertoire et déclenche l’appel via l’API téléphonique d’Android. Pendant la conversation, Gemini reçoit le flux audio en temps réel, le transcrit, le traite et peut proposer des réponses ou des actions (par exemple, prendre un message). Le traitement repose sur le modèle multimodal de Gemini, qui combine texte et parole, et utilise le service de synthèse vocale de Google pour générer les réponses de l’assistant.

Le processus repose sur plusieurs couches : l’application Pixel Phone agit comme client, le backend Gemini fournit l’inférence, et le système d’exploitation Android orchestre les autorisations d’accès au microphone, aux contacts et à la téléphonie. La latence observée lors des tests internes est de l’ordre de quelques centaines de millisecondes, ce qui rend l’interaction fluide.

Implications et limites

Cette intégration élargit les scénarios d’usage de l’assistant vocal, notamment pour les utilisateurs qui souhaitent garder les mains libres. Elle repose toutefois sur une connexion internet active ; aucune exécution locale complète n’est possible, ce qui soulève des questions de confidentialité. Google indique que les données vocales sont traitées conformément à sa politique de confidentialité, mais la transmission vers les serveurs reste un point d’attention pour les utilisateurs soucieux de la vie privée.

Le service est actuellement limité aux modèles Pixel lancés après 2023 et aux langues prises en charge par Gemini, principalement l’anglais et le français. Aucun chiffre officiel n’a été communiqué concernant le taux d’erreur de transcription ou la consommation énergétique supplémentaire induite par le traitement en temps réel.