Méthodologie du benchmark

Le test a été réalisé le 27 septembre 2026 sur 42 paires de pages synthétiques couvrant sept types de mise en page. Chaque paire diffère d’une ligne : l’une contient la valeur recherchée, l’autre non. Les extracteurs devaient renvoyer null lorsqu’aucune donnée n’était présente. L’instruction explicite « Use null for any field whose value is not on the page. Do not guess. » a été fournie à la moitié des participants, tandis que l’autre moitié a reçu la même tâche sans cette phrase. Le tableau suivant montre les performances avec et sans l’instruction.

Use null for any field whose value is not on the page. Do not guess.

Résultats chiffrés et impact de l'instruction

Sans la phrase, les 16 modèles ont généré 405 champs inventés sur 573 champs manquants, soit 70,7 %. Avec l’instruction, le nombre de champs fictifs chute à 116 sur 574, soit 20,2 %. Cette réduction de 50 points de pourcentage se confirme dans la plupart des modèles : Gemini 3.8 Flash passe de 14 % à 0,5 % (1/36), GLM 5.3 de 18 % à 0,5 % (1/35), et DeepSeek V4.1 de 24 % à 3 % (3/35). Les modèles les plus performants, GPT‑6 Luna et Jev, affichent respectivement 5 % et 8 % de champs inventés avec l’instruction.

Analyse des coûts et des vérificateurs

Le coût d’exécution du scénario « with » (avec instruction) pour l’ensemble des 84 pages est indiqué dans la colonne « Run cost ». GPT‑6 Luna, le plus économique, ne coûte que 0,0049 $ pour l’ensemble du run, tandis que Gemma 4 31B atteint 0,0037 $. Un vérificateur secondaire a été testé : GPT‑6 Luna a détecté 38 valeurs inventées sur 49 suspectes, alors que Jev en a détecté 23 sur 49, sans rejeter aucune valeur correcte. Sur les 24 champs inventés par Firecrawl, GPT‑6 Luna a identifié 20, montrant que le contrôle de cohérence peut être réalisé pour quelques centimes seulement.

Limites et perspectives

Le benchmark repose sur une unique exécution par modèle ; aucune répétition n’a été effectuée, ce qui limite la robustesse statistique. Les pages sont artificielles et les pièges (ex. « Was $493.00 ») ne reflètent pas forcément la diversité du web réel. De plus, les API payantes ont été testées en mode gratuit, ce qui peut sous‑estimer les performances ou les coûts réels. Malgré ces réserves, les résultats démontrent que l’ajout d’une consigne explicite « Do not guess » améliore sensiblement la fiabilité des extracteurs web, ouvrant la voie à des agents acheteurs capables de vérifier chaque champ pour une fraction de centime.