Présentation

Le projet Hermes a mobilisé 1 393 sous‑agents pendant environ 19 heures actives afin de refactorer un dépôt Python de plus d’un million de lignes. L’objectif était de supprimer le code source non couvert par les tests, ce qui a permis d’éliminer 34,4 % du code non‑testé pour un coût de modèle estimé à 19 300 $.

Architecture de l’opération

Les sous‑agents ont été orchestrés via des worktrees Git, chaque worktree représentant une branche isolée où les modifications étaient appliquées. Une baseline gelée a servi de référence immuable, garantissant que les changements pouvaient être comparés sans interférence de versions intermédiaires. Cette configuration a permis une intégration parallèle : chaque agent pouvait pousser ses modifications sans bloquer les autres, tout en conservant la cohérence du dépôt principal grâce à des merges automatisés suivis d’une validation manuelle.

Analyse des résultats

Le processus a généré une réduction nette de 34,4 % du code non‑testé, traduisible en une diminution de la surface d’attaque potentielle et d’une amélioration de la maintenabilité. Le coût de 19 300 $ reflète l’utilisation de modèles d’IA capables de comprendre et de réécrire du code à grande échelle, incluant le calcul du temps de génération et le nombre de tokens traités. Malgré l’efficacité du pipeline, la révision communautaire a identifié deux classes d’erreurs non détectées par les tests automatisés : la suppression d’API publiques et la modification de la gestion d’exceptions, soulignant les limites des suites de tests traditionnelles face à des transformations massives.

Risques et limites

Le recours à une coordination massive d’agents introduit plusieurs vecteurs de risque. Premièrement, la dépendance à des worktrees multiples augmente la complexité de la gestion des conflits de fusion, surtout lorsqu’une même fonction est modifiée par plusieurs agents. Deuxièmement, la confiance placée dans les baselines gelées suppose que la version de référence reste pertinente pendant toute la durée de l’opération ; tout dérive peut entraîner des régressions silencieuses. Enfin, le coût financier, bien que justifiable par le gain de productivité, reste proportionnel au nombre d’agents et à la taille du modèle, ce qui peut limiter la reproductibilité du processus pour des équipes disposant de budgets plus restreints.