Contexte et adoption
En 2026, les agents d’intelligence artificielle sont déployés dans la rédaction de code, le support client, la détection d’incidents IT et l’exécution de tâches complexes. Leur popularité provient de la capacité à interagir en langage naturel et à orchestrer des outils externes. Cette diffusion s’accompagne d’une visibilité accrue des incidents où les agents sortent de leurs environnements contrôlés.
Nondéterminisme des modèles de langage
Les agents actuels s’appuient sur de grands modèles de langage (LLM). Un LLM génère chaque token en prédisant la probabilité du mot suivant à partir du contexte fourni. Les stratégies de décodage – température, top‑p, échantillonnage aléatoire – introduisent une variabilité : deux requêtes identiques peuvent produire des réponses différentes. Cette propriété, qualifiée de nondéterminisme, confère aux agents la capacité de « prendre des décisions » en fonction d’informations partielles, mais empêche toute garantie de réplication exacte.
Contrairement aux logiciels traditionnels, où le même jeu d’entrées conduit toujours au même résultat, les agents ne respectent pas ce principe de prévisibilité. Le nondéterminisme est partagé avec des approches comme le renforcement ou les simulations Monte‑Carlo, mais ces dernières restent limitées à des domaines clairement définis, alors que les agents LLM visent des contextes plus ouverts.
Scénarios où les agents sont inadaptés
Lorsque le besoin est de garantir une réponse exacte – par exemple le calcul de la paie, le traitement de transactions bancaires ou l’allocation de sièges – le recours à un agent introduit un risque inutile. Un seul écart peut entraîner des pertes financières ou des violations réglementaires.
Dans les environnements où une défaillance peut causer un préjudice grave – soins hospitaliers, aviation, exploitation pétrolière – même une probabilité de dysfonctionnement très faible devient inacceptable. Le coût d’une mauvaise décision dépasse largement le bénéfice potentiel de l’automatisation.
Les agents consomment plusieurs appels LLM, parfois avec des reprises et l’invocation d’outils externes. Chaque appel représente un coût de calcul qui s’accumule rapidement. Si le ratio coût/bénéfice n’est pas favorable, l’option reste économiquement défavorable.
Enfin, les tâches nécessitant une véritable empathie, créativité ou jugement humain ne doivent pas être confiées à un simulateur de langage. L’anthropomorphisation des agents crée une illusion de compréhension qui peut conduire à une dépendance excessive et à des comportements à risque, comme la prise de décisions critiques basées sur une fausse confiance.
Méthode d’évaluation : budget d’erreur
Pour décider du déploiement, les équipes SRE peuvent appliquer le concept de budget d’erreur. On définit un pourcentage acceptable d’échecs d’agent (par exemple 5 %). Ce budget se compare au coût total d’une défaillance (perte de vie, arrêt de production, amende). Si le produit du budget d’erreur et du coût de la défaillance dépasse le bénéfice attendu, l’agent ne doit pas être utilisé.
Un budget nul indique que l’agent ne satisfait aucune contrainte de fiabilité ou de coût. Cette approche quantifie le risque plutôt que de se fier à une intuition vague.