Présentation
Project Arena, publié sous licence MIT sur GitHub, fournit un environnement de test « vendor‑neutral » dédié aux agents d’investigation IA opérant sur des clusters Kubernetes. Le cadre permet de déployer un cluster jetable, d’injecter des fautes, d’enregistrer les investigations réalisées par n’importe quel produit SRE, puis de les évaluer à l’aide d’un juge IA configurable. Le projet ne requiert que Python 3.10+ comme dépendance logicielle, ainsi que kubectl, Docker et kind pour la création locale de clusters, ou un cluster AWS EKS pour les tests en cloud.
Architecture et fonctionnement
Le processus se décline en cinq étapes clairement séparées : déploiement du cluster et de l’application cible, connexion du produit SRE, injection et vérification d’une faute, exécution de l’investigation par le produit, puis sauvegarde et notation des résultats. Chaque étape est scriptée dans le répertoire du projet, ce qui garantit la reproductibilité. Le choix du type de cluster (local kind ou EKS) et de la suite de scénarios (21 scénarios complets ou six scénarios de fumée) est paramétrable via des fichiers de configuration. Le diagramme suivant, extrait du README, illustre le flux :
flowchart LR
A[Deploy cluster and application] --> B[Connect your product]
B --> C[Inject and verify a fault]
C --> D[Let your product investigate]
D --> E[Save investigation records]
E --> F[Score with your chosen judge]
F --> G[Compare results]
Le juge IA, par défaut GPT‑6‑Astra, compare les rapports d’investigation aux faits d’incident connus et attribue des scores selon cinq métriques : détection, analyse de cause racine, rayon d’impact, mitigation finale supportée et préparation à l’implémentation.
Analyse des résultats et limites
Les premiers benchmarks publiés évaluent trois solutions : l’outil natif d’Edge Delta, l’outil natif de Grafana et le modèle LLM Claude (déployé via les plateformes edx et gcx). Sur l’ensemble des 21 scénarios, Edge Delta détecte 18 incidents (85,7 %), Grafana 12 (57,1 %). Claude n’est pas mesuré pour la détection, les cellules correspondantes restent vides. En analyse de cause racine, Edge Delta réussit 15/18 (83,3 %) tandis que Grafana atteint 9/12 (75 %). Claude obtient 18/21 (85,7 %) via edx et 19/21 (90,5 %) via gcx, montrant une supériorité sur les deux produits natifs.
Pour le rayon d’impact, Edge Delta et Grafana obtiennent respectivement 12/18 (66,7 %) et 8/12 (66,7 %). Claude dépasse les deux avec 18/21 (85,7 %) dans les deux configurations. La mitigation finale supportée est la métrique la plus discriminante : Edge Delta propose 8/18 (44,4 %) de solutions viables, Grafana 5/12 (41,7 %), alors que Claude fournit 16/21 (76,2 %) via edx et 15/21 (71,4 %) via gcx. Enfin, la préparation à l’implémentation (implementation readiness) suit la même tendance, Claude atteignant 56,2 % à 71,4 % contre moins de 50 % pour les solutions natives. Une comparaison restreinte aux 12 scénarios communs confirme ces écarts, avec Claude maintenant des scores compris entre 83,3 % et 91,7 % selon la métrique.
Ces résultats soulignent la capacité actuelle des LLM à surpasser les outils d’observabilité traditionnels dans la génération de diagnostics complets. Cependant, la méthodologie repose sur un juge IA unique, ce qui introduit un biais de référence : les scores reflètent la conformité aux critères définis par GPT‑6‑Astra, pas nécessairement la pertinence opérationnelle. De plus, la dépendance à un cluster pré‑configuré limite l’évaluation à des environnements standardisés, alors que les clusters de production peuvent présenter des topologies et des contraintes de sécurité très différentes. Enfin, l’absence de mesure de la détection pour Claude empêche une comparaison exhaustive de la rapidité d’alerte, un facteur critique en SRE.