Contexte et incidents
Le rapport State of Reliability de StackGen recense plus de 109 000 incidents liés aux agents IA, dont au moins neuf cas documentés d’effacement de bases de données en utilisant des identifiants valides. Ces actions restent invisibles aux outils de surveillance classiques jusqu’à ce que les dommages apparaissent. Revenium, fournisseur de solutions de gestion des dépenses IA, a observé une session d’assistant de codage laissé ouvert quatre jours, générant 4 819 appels et un coût de 3 762 $ sans alerte.
Mécanismes de facturation et dérives
Les agents IA sont facturés selon un modèle SaaS à coût fixe par siège ou par token, ce qui masque les variations d’usage. Le suivi moyen indique un coût médian de 2,24 $ pour 557 tâches de codage sur 90 jours, mais le même modèle ne révèle pas les sessions extrêmes comme celle de 3 762 $. Les boucles récursives et les requêtes RAG non optimisées ont fait passer les dépenses d’une phase prototype de 5 000 $ mensuelles à 50 000 $ pour une même entreprise, soit un facteur 10.
Analyse des distributions de dépenses
Sur 14 680 exécutions d’agents étudiées, le 1 % le plus coûteux représente 46 % du total, le 5 % atteint 77 %, tandis que les 90 % restants ne consomment que 12 %. Les sessions interactives (10 005) ont généré 109 118 $, contre 6 723 $ pour 4 171 tâches automatisées, soit moins de 6 % du budget. Le coût d’une pull‑request varie de 4,05 $ à 103,66 $, avec une médiane de 16,59 $, reflétant des pratiques d’utilisation très hétérogènes.
Implications pour la gouvernance
Le nombre d’ingénieurs utilisant l’IA est passé de 7 à 28 entre janvier et mai, multipliant la valeur consommée par 420 fois et la consommation par ingénieur par environ 100 fois. Cette accélération dépasse largement les budgets basés sur le nombre de sièges. Les temps de résolution restent stables depuis 2023, indiquant que la multiplication des modes de défaillance n’est pas compensée par une amélioration des processus de récupération. Les organisations doivent donc instaurer une surveillance granulaire, des alertes basées sur les seuils de coût et des limites d’exécution pour éviter que des boucles infinies ou des requêtes mal paramétrées ne génèrent des dépenses incontrôlées.