Contexte et objectifs

JevBench v1.3.0 est le benchmark interne de Benchmark Heaven dédié aux modèles de décision de type Jev. Ces modèles reçoivent une entrée typée et renvoient une réponse également typée, ce qui les rend adaptés à des tâches de prise de décision automatisée. L’objectif principal du benchmark est de fournir une mesure unique, le JevBench Score, qui combine intelligence, calibration, vitesse et coût, afin de comparer objectivement les offres disponibles sur le marché.

Méthodologie du benchmark

La version 1.3.0 a évalué 52 systèmes sur un jeu de 534 décisions réparties en 72 faciles, 96 standards, 146 jugées et 220 difficiles. Chaque décision a été soumise séparément à un serveur situé en Allemagne, avec une requête à la fois, garantissant l’absence d’effet de lot. Le protocole utilisé est indiqué comme

protocol jevbench::v1.2
. Les scores sont calculés comme la moyenne géométrique des quatre sous‑scores (Intelligence, Calibration, Speed, Cost), chacun pondéré à 25 %. Un facteur de pénalité s’applique lorsque l’intelligence chute sous 50 % : le score est multiplié par (I/50)².

Le coût est exprimé en dollars par mille tokens ($/1k dec.) et intégré dans le calcul du score, ce qui oblige les modèles à concilier performance et efficacité économique.

Analyse des performances

Le modèle Jev 1.13.0 occupe la première place avec un score de 74,4, affichant 86 % d’intelligence, 83 % de calibration, 83 % de vitesse et un coût de 0,040 $/1k dec. Le deuxième rang, SemIf (Qwen3.5‑4B), atteint 73,1 de score tout en proposant un coût inférieur (≈ 0,022 $/1k dec). Cette différence montre que le benchmark favorise les modèles qui maintiennent une haute précision tout en restant économiques.

Les modèles les moins performants, comme GLiNER2.5 small (score 13,8) ou Certo v1 (score 0,0), affichent des intelligences très basses (≤ 7 %) mais des coûts très faibles (≈ 0,001 $/1k dec). Leur faible score résulte principalement de la pénalité d’intelligence, soulignant que le benchmark ne sacrifie pas la qualité au profit du prix.

Un autre point notable est la dispersion du sous‑score « Calibration », qui mesure la capacité du modèle à estimer correctement ses propres probabilités. Des modèles comme DeepSeek V4.1 Flash obtiennent 97 % de calibration mais restent pénalisés par un coût élevé (0,594 $/1k dec), ce qui les place à la 28ᵉ position.

Limites et perspectives

Le benchmark repose sur un unique serveur d’inférence en Allemagne, ce qui peut introduire une latence non représentative pour les déploiements hors‑UE. De plus, le jeu de décisions, bien que diversifié, reste figé ; les performances sur des tâches émergentes ou des domaines spécifiques ne sont pas évaluées. Enfin, le coût est calculé à partir du tarif public indiqué par chaque fournisseur, sans tenir compte d’éventuelles remises ou de la variabilité du prix selon le volume.

Pour enrichir l’analyse, il serait utile d’ajouter des métriques de robustesse face aux entrées adversariales et de publier les logs d’inférence afin de vérifier la reproductibilité. Malgré ces réserves, JevBench fournit une base quantitative solide pour comparer les modèles de décision typés, en mettant en évidence le compromis entre performance et coût.