Présentation de Jeff et de son objectif

Jeff est une suite de modèles de classification zéro‑shot dérivés de Qwen3.5 et Gemma 4. Leur taille varie de 0,8 milliard à 2 milliards de paramètres, ce qui les rend adaptés à une exécution locale rapide. Le principe repose sur une unique passe avant qui renvoie une probabilité calibrée pour chaque option décrite en texte libre, sans génération de texte intermédiaire.

Architecture et performances d’inférence

Les modèles utilisent l’architecture transformer standard des familles Qwen et Gemma, mais avec un nombre de couches réduit pour atteindre les 0,8 B et 2 B de paramètres. Sur un GPU RTX PRO 6000, le modèle 0,8 B réalise une décision en environ 22 ms, tandis que le même modèle sur Apple M4 Max (backend MLX) atteint 28 ms. Le format de requête accepte trois types de questions : choice (jusqu’à 255 options), noul (oui/non) et score (valeur sur une échelle définie). Le serveur s’installe via

uv run jeff-serve
et accepte les appels HTTP POST, comme illustré ci‑dessous :
curl -s localhost:8765/v1/systemone \
  -H 'content-type: application/json' \
  -d '{
    "model": "jeff-latest",
    "state": "Refund request: the parcel arrived crushed.",
    "questions": {
      "route": {"type": "choice", "instructions": "Which team should handle this?", "criteria": {"1": "Refunds", "2": "Damaged parcels", "3": "Account issues"}},
      "angry": {"type": "noul", "instructions": "Is the customer angry?"}
    }
  }'
Chaque réponse comporte la probabilité de chaque option, l’option retenue et un indice de confiance.

Résultats des benchmarks

Jeff a été évalué sur 4 599 questions provenant de cinq jeux publics (BBH, Financial PhraseBank, JudgeBench, RAGTruth, WinoGrande) et sur le niveau « hard » de JevBench (105 items). Le tableau suivant résume les scores globaux :

Modèle                | Overall | BBH  | Financial | JudgeBench | RAGTruth | WinoGrande | JevBench‑hard
----------------------+---------+------+-----------+------------+----------+------------+--------------
Qwen3.5‑0.8B (raw)    | 45.3    | 39.5 | 36.0      | 56.6       | 49.1     | 49.2       | 36.2
Jeff‑Qwen3.5‑0.8B    | 79.1    | 64.0 | 96.4      | 62.6       | 86.1     | 68.6       | 47.6
Qwen3.5‑2B (raw)      | 46.5    | 46.0 | 53.4      | 57.4       | 35.9     | 52.2       | 45.7
Jeff‑Qwen3.5‑2B      | 83.1    | 68.0 | 96.3      | 64.6       | 88.9     | 79.0       | 53.3
Gemma‑4‑E2B (raw)    | 62.5    | 51.3 | 86.0      | 46.9       | 63.8     | 51.0       | 41.0
Jeff‑Gemma4‑E2B      | 81.6    | 66.4 | 96.1      | 60.6       | 87.4     | 77.4       | 48.6
Jev (published)      | 83.0    | 94.3 | 77.0      | 78.6       | 77.3     | 90.7       | 73.3
AutoJev‑27B (pub.)   | 84.9    | 82.8 | 84.2      | 78.9       | 88.9     | 83.3       | 70.3

Jeff dépasse largement les modèles non entraînés sur chaque jeu, et se rapproche des performances de Jev sur les tâches de classification pure. En revanche, sur les benchmarks à forte charge de raisonnement (BBH, JudgeBench, JevBench‑hard), les scores restent nettement inférieurs aux modèles de plusieurs dizaines de milliards de paramètres.

Entraînement local et possibilités de fine‑tuning

Le modèle 0,8 B s’entraîne en environ 2 heures sur un seul RTX PRO 6000, tandis que le 2 B nécessite 3,5 heures sur le même matériel. Les données d’entraînement sont synthétiques, générées par le modèle ouvert Qwen3.8‑Flash‑Next sur deux serveurs DGX Spark. Aucun GPU cloud n’est utilisé et aucune sortie de modèle fermé n’est intégrée, à l’exception d’un contrôle ponctuel de la qualité. Un fine‑tune de 30 minutes sur un jeu vocal a fait passer la précision hors‑échantillon de 31,7 % à 95,8 %, démontrant que le même pipeline peut être adapté rapidement à des domaines spécifiques sans recourir à des ressources externes.

Ces caractéristiques font de Jeff une solution viable pour les applications embarquées ou les services à faible latence où la puissance de calcul est limitée, tout en conservant une capacité zéro‑shot suffisante pour des classifications génériques. La limitation principale réside dans la profondeur de raisonnement, qui reste l’apanage des modèles beaucoup plus volumineux.