Présentation des résultats

Les résultats des tests de 13 modèles et 4 agents sur des tâches SWE (Software Engineering) ont été publiés sur le site SWE-rebench. Les modèles testés incluent Anthropic Fable, Grok, Anthropic Opus, Z.ai GLM-5.2, OpenAI GPT-5.6 Sol, Junie, Anthropic Claude Code Agent, OpenAI Codex Agent, Anthropic Sonnet, Cursor, Minimax MiniMax M3, XiaomiMiMo MiMo V2.5 Pro et OpenAI GPT-5.6 Luna.

Analyse des performances

Les résultats montrent que les modèles Anthropic Fable, Grok et Anthropic Opus ont obtenu les meilleurs taux de résolution, avec respectivement 64,5%, 63,8% et 63,4% de problèmes résolus. Les modèles Z.ai GLM-5.2 et OpenAI GPT-5.6 Sol ont également obtenu de bons résultats, avec respectivement 62,9% et 62,3% de problèmes résolus.

Coûts et complexité

Les coûts et la complexité des modèles varient également. Les modèles Anthropic Fable et Anthropic Opus ont des coûts élevés, avec respectivement 4,40$ et 3,47$ par problème, tandis que les modèles Z.ai GLM-5.2 et OpenAI GPT-5.6 Sol ont des coûts plus bas, avec respectivement 1,40$ et 0,85$ par problème.

Limites et perspectives

Les résultats de ces tests montrent que les modèles de langage peuvent être efficaces pour résoudre des problèmes de génie logiciel, mais qu'il existe encore des limites et des défis à relever. Les futurs travaux devraient se concentrer sur l'amélioration de la précision et de la robustesse des modèles, ainsi que sur la réduction de leurs coûts et de leur complexité.