Méthodologie expérimentale

Le test s’appuie sur 75 dépôts factices, répartis sur 10 langages, avec des historiques Git, des clés API factices et des lockfiles vérifiés contre les registres npm. Chaque dépôt a servi à exécuter 16 893 runs, dont 5 292 sessions ont été retenues après filtrage selon des critères de validité (absence de biais préexistant, présence d’une solution implémentée). Les expériences ont été isolées dans des sandbox éphémères fournis par trois fournisseurs – E2B, Blaxel et Daytona – afin d’éliminer l’influence du fournisseur de sandbox. Un « humain simulé » orchestré par Gemini 3.7 Flash a introduit un dialogue à deux tours : analyse du code, proposition de solution, puis validation ou demande de clarification. Un second agent Gemini 3.7 Flash a jugé chaque session, en vérifiant la pertinence de la solution et en identifiant le fournisseur final mentionné dans le diff de code.

Comportement des agents de codage

Cursor s’appuie sur le web dans environ deux tiers des sessions, alors que Codex utilise une recherche web dans 94 % des cas, souvent avec des opérateurs de domaine (ex. site:) pour cibler des sources fiables. Claude Code ne recourt au web que dans 30 % des sessions globales, mais augmente ce taux à 80 % dans des secteurs où ses connaissances internes sont faibles, comme les sandbox. La convergence entre les trois agents est limitée : ils sélectionnent le même outil dans seulement 42 % des cellules d’évaluation. Claude Code construit des solutions en interne dans 19 % des cas, contre 10 % pour Codex et Cursor.

Impact du contexte du dépôt

Le même besoin d’envoi d’e‑mail a conduit à quatre fournisseurs différents selon le langage du dépôt : Resend a été choisi 55 fois sur 89 runs en TypeScript, Sendgrid 22 fois sur 24 en Python, Postmark 20 fois sur 24 en Go, et Azure ACS 22 fois sur 23 en Java. Vercel a dominé les dépôts TypeScript, notamment lorsqu’ils utilisaient NextJS, mais n’est jamais apparu dans les dépôts Python où Render a prévalu. La simple mention d’un fournisseur ne garantit pas sa sélection : Paypal a été cité 139 fois sans jamais être retenu, Stripe a remporté 124 de ces sessions, tandis qu’Adyen, mentionné 175 fois, n’a été choisi que trois fois.

Limites et perspectives

Les résultats soulignent la sensibilité des agents aux informations de présentation. Par exemple, Mailgun a perdu face à Postmark lorsque les plans gratuits affichaient une rétention d’un jour, et Supabase a été éclipsé par Neon en raison de fonctionnalités BaaS superflues (auth, stockage, realtime) présentées dans une tarification groupée. Sur les 5 292 sessions, 388 ont évoqué la surcharge de gestion de plateforme et 195 les coûts, indiquant que la formulation des offres influence les décisions automatisées. Le jeu de données complet reste public, permettant de reproduire l’étude ou d’explorer des variables non analysées, telles que l’impact de prompts plus détaillés ou de nouvelles versions d’agents.}