Contexte du benchmark
DoGBench, publié par Promptless, constitue le premier référentiel dédié à l’évaluation d’agents capables de générer ou de mettre à jour la documentation utilisateur d’un projet logiciel. Le jeu de données comprend 292 tâches extraites de dépôts réels (Helm, PostHog, Mautic, Doc Detective). Parmi ces tâches, 205 exigent une modification de la documentation, tandis que 87 requièrent de laisser le texte inchangé. Cette répartition reflète la décision fondamentale que doit prendre tout rédacteur : identifier si un changement de code implique une mise à jour de l’aide utilisateur.
Méthodologie d’évaluation
Chaque agent reçoit le dépôt tel qu’il existait avant le commit déclencheur (pull‑request ou signal de lacune) et doit proposer un patch de documentation. Les correctifs sont notés à l’aide de rubriques détaillées : précision, exhaustivité, guidage du lecteur, placement, style et conformité aux conventions du dépôt. Au total, 3 273 critères sont appliqués aux 205 items nécessitant une mise à jour, dont 798 sont classés P0 (défaillances critiques). Le score composite combine deux sous‑mesures : la qualité moyenne des correctifs livrés (D) et le rappel d’abstention correcte (N), calculé par la moyenne harmonique 2DN / (D + N). Un défaut P0 entraîne un plafonnement du score à 60/100, même si les critères secondaires sont satisfaits.
Résultats et performances
Le benchmark a testé dix systèmes : sept agents locaux et trois agents cloud. Sur le sous‑ensemble de validation de 117 items (82 à mettre à jour, 35 à laisser inchangés), le meilleur score composite parmi les agents locaux est de 47,3 / 100, atteint par Qwen3.8 Max avec le harness OpenCode. Les agents cloud obtiennent un score supérieur, le plus haut étant 54,8 / 100. En termes de livrables « P0‑clean », le meilleur taux est de 39,0 %, réalisé par le même Qwen3.8 Max. GPT‑5.6 Sol avec Codex a produit 32 correctifs P0‑clean sur les 82 items nécessitant une mise à jour, soit 39 % de réussite.
Une analyse plus large de 1 267 soumissions révèle des lacunes fréquentes : 45,5 % des correctifs omettent une étape ou un prérequis indispensable, 36,6 % contiennent des inexactitudes techniques, 32,5 % laissent de côté une notion centrale, et 6,1 % inventent des éléments (classes, flags, endpoints). Ces défauts se recoupent souvent, montrant que la rédaction polie ne garantit pas la complétude fonctionnelle.
Limites et perspectives
DoGBench mesure la capacité à atteindre un standard d’expert, mais ne compare pas directement les agents à un rédacteur humain. Le benchmark ne couvre pas les scénarios où la documentation doit être adaptée à des audiences spécifiques ou à des flux de travail complexes, ce qui reste du ressort du propriétaire du dépôt. De plus, les agents cloud ont été contraints de ne pas accéder à Internet ; la vérification de cette restriction n’a pu être assurée que pour Promptless, introduisant une incertitude sur les performances des autres services. Enfin, le plafonnement à 60 / 100 en cas de défaut P0 peut masquer des progrès substantiels sur les critères secondaires, limitant la granularité de l’interprétation des scores.