Contexte et objectifs

L’étude porte sur les harnesses qui orchestrent les agents de codage autonomes. Les auteurs soulignent que la plupart des travaux évaluent ces harnesses comme des systèmes monolithiques, masquant l’impact réel de chaque composant. L’objectif est donc de disséquer trois leviers : la planification, l’espace d’action et la gestion du contexte, afin d’identifier les gains de performance et de coût selon le modèle et le budget de fenêtre contextuelle.

Méthodologie expérimentale

Quatre modèles de langage ont été testés sur les jeux de référence SWE‑Bench Verified et Terminal‑Bench 2.1. Le protocole comprend 176 configurations combinant cinq stratégies de gestion du contexte, quatre budgets de taille de fenêtre et des ablations ciblées de planification et d’espace d’action. Le bouclage d’exécution du harness reste fixe, garantissant que les variations observées proviennent uniquement des composants étudiés.

Résultats clés

1. Gestion du contexte : lorsque le budget de fenêtre se restreint, la valeur ajoutée de la gestion du contexte augmente fortement, principalement en évitant les context‑overflow failures. 2. Élision règle‑basée + résumé LLM : la séquence « rule‑based elision » puis « LLM summarization » maximise l’efficacité globale. Rendre le contenu élidé récupérable introduit une surcharge que les modèles n’exploitent presque jamais, sans amélioration de précision. 3. Planification : pour les modèles faibles, la planification agit comme un échafaudage d’exactitude, tandis que pour les modèles forts, elle réduit le coût en limitant le nombre d’étapes inutiles, la précision restant stable. 4. Espace d’action : les outils prédéfinis (ex. : fonctions de manipulation de fichiers) profitent aux modèles peu à l’aise avec Bash, alors que les modèles maîtrisant Bash fonctionnent efficacement avec une interface « bash‑only », ce qui diminue sensiblement le coût, surtout sur les tâches centrées sur la ligne de commande.

Implications et limites

Analyse au niveau des trajectoires montre que la gestion du contexte prolonge les séquences d’exécution sans modifier le comportement décisionnel, la planification détermine le point d’arrêt des trajectoires, et l’espace d’action influe sur la granularité du code produit. Ces observations suggèrent que la conception de harnesses doit être adaptée au modèle (faiblesse ou force en Bash) et au budget de fenêtre disponible. Toutefois, l’étude se limite à quatre modèles et à deux benchmarks ; la généralisation à d’autres domaines de programmation ou à des fenêtres beaucoup plus larges reste à vérifier.