Présentation du modèle MAI‑Transcribe‑2‑Streaming
Microsoft a ajouté à sa famille MAI un modèle de transcription en flux continu nommé MAI‑Transcribe‑2‑Streaming. Le service accepte l’audio via WebSocket et renvoie un texte mis à jour dès que le locuteur poursuit son discours. Une fois la prise de parole terminée, le texte est marqué comme définitif. Le modèle est proposé sur le Vercel AI Gateway au tarif de 0,54 $ par heure d’audio et supporte plus de 60 langues avec détection automatique.
Architecture et flux de données
Le pipeline commence par la capture du flux audio, qui est découpé en fenêtres de quelques dizaines de millisecondes. Chaque fenêtre est traitée par le réseau de neurones du modèle, qui génère une hypothèse partielle. Ces hypothèses sont agrégées en temps réel, ce qui explique le délai moyen de 320 ms avant la première sortie texte. Le processus repose sur une infrastructure cloud à faible latence ; toutefois Microsoft précise que la performance dépend aussi de la connexion réseau et du système d’inférence qui produit la réponse finale.
Performances, coûts et comparaison avec les modèles existants
Le modèle non‑streaming MAI‑Transcribe‑2, lancé le mois précédent, coûte 0,10 $ par heure d’audio, soit près de cinq fois moins cher. La différence de prix reflète la charge supplémentaire du calcul continu et du maintien d’états intermédiaires. En parallèle, Microsoft a publié deux modèles de synthèse vocale, MAI‑Voice‑2.1 et MAI‑Voice‑2.1‑Flash, facturés respectivement à 22 $ et 15 $ par million de caractères, et couvrant 23 langues. Le modèle « Flash » privilégie la rapidité et le coût réduit, tandis que le modèle standard vise une fidélité plus élevée.
Implications pour les agents vocaux
En combinant MAI‑Transcribe‑2‑Streaming avec les modèles de synthèse vocale et le modèle de raisonnement Mai‑Thinking‑1, les développeurs peuvent assembler une chaîne complète : reconnaissance, compréhension, décision et génération de réponse. Cette modularité permet d’ajuster séparément la latence, la qualité et le budget, ce qui est essentiel pour des applications comme les sous‑titres en direct ou les assistants qui réagissent avant la fin de la phrase de l’utilisateur. Microsoft indique que ces modèles visent à réduire la dépendance aux fournisseurs externes tels qu’OpenAI ou Anthropic, dont les coûts sont jugés élevés. La stratégie montre une volonté d’intégrer davantage de capacités IA en interne pour alimenter les agents Copilot dans les suites Office.