Contexte et principe de Jev

Jev est le nouveau modèle « System One » de TypeSafe. Il repose sur un transformeur pré‑entraîné auquel est ajouté un classifieur en sortie. Contrairement aux grands LLM classiques (Claude, GPT) qui génèrent du texte de façon autoregressive, Jev reçoit un contexte et une question à choix multiples, puis renvoie une distribution de probabilité sur les réponses proposées. Cette architecture vise à offrir la souplesse d’un LLM tout en restant un classifieur, avec un coût d’expérimentation inférieur à 4 $.

jev("2+2=?", "3 : int, 4 : int, 5 : int")

Méthodologie d’évaluation de la calibration

Pour mesurer la fidélité des probabilités renvoyées, l’auteur a sélectionné dix lois de probabilité physiques (Gaussienne, Lorentzienne, Maxwell‑Boltzmann, Gamma, Exponentielle, Rayleigh, Uniforme, Poisson, Binomiale, Boltzmann). Chaque loi a été associée à cinq modèles de prompts, puis chaque modèle a été décliné en vingt variations (température, contexte, etc.), soit 1 000 appels à Jev. Les réponses sont binned dans des intervalles fixes : 48 ou 49 bins selon la loi, avec des bords ouverts pour les distributions à queue longue.

Le critère de comparaison est la distance de variation totale (TV) : TV(q,p)=½∑|q_i‑p_i|, où q_i est la probabilité fournie par Jev et p_i l’intégrale de la densité théorique dans le même bin. TV=0 indique une correspondance parfaite, TV=1 une discordance totale.

Résultats quantitatifs

Le score moyen de Jev sur l’ensemble des expériences est TV=0.518. À titre de référence, un modèle qui répartit uniformément la probabilité sur les K choix obtient TV=0.546. Ainsi, Jev se situe légèrement en dessous d’une stratégie naïve. L’écart dépend fortement de la loi testée : pour la loi Uniforme, Jev atteint TV=0.77 contre 0.39 pour le pari plat, ce qui montre une sur‑confiance dans certaines bins. Pour la loi Poisson, le résultat est TV=0.65, très proche du 0.64 du pari plat, indiquant une calibration tout aussi médiocre que le hasard. Les autres lois (Gaussienne, Maxwell, etc.) affichent des TV intermédiaires, mais aucune n’approche la perfection.

Analyse des limites et perspectives

Plusieurs facteurs expliquent cette mauvaise calibration. Premièrement, le classifieur ajouté n’est pas entraîné spécifiquement sur des tâches de distribution de probabilité ; il doit généraliser à partir d’un jeu de données de classification générique, ce qui limite sa capacité à modéliser les densités continues. Deuxièmement, la sortie probabiliste d’un transformeur reste intrinsèquement stochastique ; sans mécanisme de recalibrage (par exemple Platt scaling ou isotonic regression), les scores bruts reflètent davantage la confiance du modèle que la vraie probabilité. Enfin, le découpage en bins fixes introduit un biais de bord : les erreurs se concentrent souvent dans les bins extrêmes, d’où les « spiked edges » observés dans les graphiques.

Ces constats suggèrent que l’usage de Jev comme juge automatisé (ex. JevEval) doit être limité à des scénarios où la calibration n’est pas critique, ou bien accompagné d’une étape de post‑traitement calibrant les scores. Des travaux futurs pourraient explorer un entraînement fin‑tuned du classifieur sur des distributions connues, ou l’intégration de techniques de calibration probabiliste pour réduire le TV moyen en dessous du seuil de la stratégie uniforme.