Présentation des nouvelles fonctions vocales

OpenAI a annoncé le 23 septembre 2026 l’ajout de capacités vocales « agentic » à l’application mobile ChatGPT. Les abonnés Plus et Pro peuvent désormais activer l’onglet Work depuis leur smartphone pour lancer des flux de travail tels que la rédaction de documents, la création de présentations, la synthèse d’e‑mails ou de messages Slack, voire la génération de sites web et l’accès à des données financières. Les utilisateurs des niveaux Free et Go conservent l’accès aux plugins et aux applications connectées, mais sans l’onglet Work dédié. La conversation vocale produit un texte plus riche et l’utilisateur peut basculer entre texte et voix, puis reprendre la même session sur le bureau.

Architecture technique et modèle GPT‑Live

Ces fonctions reposent sur le modèle conversationnel GPT‑Live, lancé en juillet 2026 et intégré d’abord à l’application de bureau. GPT‑Live combine un moteur de reconnaissance vocale en temps réel avec le modèle de génération de texte d’OpenAI, ce qui permet de transformer la parole en requêtes structurées. Le pipeline analyse d’abord le flux audio, le segmente en intentions, puis mappe chaque intention à une action disponible via le système de plugins d’OpenAI. Les actions sont exécutées par des micro‑services hébergés dans le cloud, qui renvoient les résultats au modèle pour enrichir la réponse textuelle. Cette chaîne de traitement minimise la latence grâce à un cache de modèles en mémoire et à une orchestration via le service interne OpenAI Orchestrator, qui gère la synchronisation entre le client mobile et le serveur desktop.

Analyse des capacités d’agentic et des limites

L’aspect « agentic » signifie que l’assistant peut initier des opérations autonomes, comme créer un fichier Google Docs ou déclencher un webhook, sans intervention manuelle supplémentaire. Cette capacité dépend de la disponibilité des plugins compatibles avec la plateforme mobile ; les abonnés Plus/Pro bénéficient d’un catalogue élargi, tandis que les comptes gratuits restent limités aux plugins publics. Le modèle vocal améliore la continuité d’usage, mais la qualité de la reconnaissance dépend fortement du bruit ambiant et de la puissance de calcul du dispositif. De plus, la séparation maintenue entre les espaces de chat et de travail, contrairement à la fusion récente d’Anthropic, impose une navigation supplémentaire pour les utilisateurs qui souhaitent basculer entre conversation et exécution de tâches.

Implications et perspectives

En déportant les fonctions de travail sur mobile, OpenAI répond à la tendance croissante d’interaction vocale pour des tâches complexes. La possibilité de reprendre une session sur le desktop renforce la cohérence multi‑plateforme, mais elle introduit également des risques de synchronisation de données sensibles, notamment lorsqu’une action financière est déclenchée via la voix. La stratégie tarifaire différenciée (Plus/Pro vs Free/Go) crée un écart fonctionnel qui pourrait pousser les utilisateurs vers les offres payantes, tout en limitant l’adoption massive des capacités agentic. Enfin, l’absence de métriques de latence ou de taux d’erreur dans l’annonce laisse incertain l’impact réel sur la productivité des utilisateurs.