Contexte et objectif

Le 2 octobre 2026, Thibaud Colas, membre de l’équipe centrale de Wagtail, a lancé un défi : consacrer le mois de septembre exclusivement à GLM 5.3 Flash, un modèle ouvert réputé pour son efficacité. L’idée était de mesurer la viabilité d’une utilisation intensive d’un seul modèle dans le cadre d’un serveur prototype nommé MCP, développé avec la méthode « vibe coding ». Le suivi de la consommation a été réalisé via AgentsView, un outil d’ingénierie agentique destiné à monitorer l’usage des IA.

Consommation, coût et empreinte carbone

Au total, 2 milliards de tokens ont été générés. La première moitié du mois a été entièrement allouée à GLM 5.3 Flash, ce qui a généré un coût de 68 $, une consommation énergétique de 4 kWh et 365 g d’émissions de CO₂. La seconde moitié a dérivé vers d’autres modèles, totalisant 1 milliard de tokens, un coût de 150 $, et une consommation supplémentaire de 5 kWh. Ces chiffres illustrent que le modèle ciblé reste le moins gourmand, mais que le glissement vers des alternatives entraîne une hausse proportionnelle du budget énergétique et financier.

Analyse technique du prototype

Le serveur MCP repose sur une architecture « vibe‑coded », c’est‑à‑dire un prototype où le code est rapidement assemblé pour valider des concepts plutôt que d’être optimisé pour la production. Cette approche a permis de déployer rapidement une démonstration fonctionnelle, mais elle a aussi introduit des inefficacités : le choix initial du modèle s’est avéré sous‑optimal, entraînant 450 M de tokens, soit 150 $ et 5 kWh, dépensés en quelques heures. Le manque de contrôle granulaire sur le routage des requêtes a favorisé le basculement vers des modèles plus coûteux, révélant une faiblesse dans la gestion des agents qui orchestrent les appels IA.

Leçons et recommandations

Premièrement, la sélection du modèle doit être alignée avec les exigences de charge dès la phase de conception, afin d’éviter des dépassements de budget. Deuxièmement, l’intégration d’un système de gouvernance des tokens, capable de limiter automatiquement le nombre de requêtes vers des modèles secondaires, aurait pu contenir la dérive observée. Troisièmement, le prototype montre que même une architecture rapide peut fournir des métriques fiables : le suivi via AgentsView a permis de quantifier précisément l’énergie consommée et les émissions associées, données essentielles pour des évaluations de durabilité. Enfin, une itération future du serveur MCP devrait envisager une refonte du code « vibe‑coded » en faveur de modules plus modulaires, afin de réduire la friction lors du changement de modèle et d’améliorer la prévisibilité des coûts.