Présentation du modèle

AWS Strands Labs a publié Strands Decider 2B, un modèle décisionnel open‑source de 2 milliards de paramètres. Contrairement aux grands modèles de langage (LLM) qui génèrent du texte, ce « System 1 model » se contente de choisir parmi des options prédéfinies et renvoie un score de confiance. L’absence de génération de texte réduit drastiquement la consommation de tokens et la latence, ce qui le rend adapté aux agentic workflows où chaque milliseconde compte.

Architecture et entraînement

Le cœur du modèle repose sur le torse de Qwen3.5‑2B, un LLM de référence. AWS a remplacé la tête traditionnelle par une « pointer head » ultra‑compacte contenant seulement 1 million de paramètres. Cette tête convertit les états cachés du torse en scores de décision via un adaptateur LoRA de rang 16, permettant d’évaluer directement chaque choix proposé. La version publiée porte la désignation v.20, résultat de multiples itérations internes visant à stabiliser le processus de scoring.

Performances et limites

Selon les benchmarks internes, Strands Decider 2B atteint une latence inférieure à 150 ms sur un ordinateur portable standard, tout en conservant une précision comparable aux autres modèles open‑source de 2 B paramètres sur le jeu de test JevBench. Le modèle montre également une bonne calibration des scores de confiance, indispensable lorsqu’aucune explication textuelle n’est fournie. Cependant, l’absence de génération de texte implique que le modèle ne peut pas justifier ses décisions, ce qui limite son usage à des tâches où la transparence n’est pas requise ou où une validation externe est possible.

Implications pour les workflows agentiques

En libérant les développeurs d’une couche de génération de texte, Strands Decider 2B accélère des fonctions telles que le routage de modèles, la sélection d’outils, la gestion de contexte, l’application de garde‑fous et la classification de politiques. AWS le rend disponible via Hugging Face et publie le code complet, les scripts d’entraînement et des exemples d’utilisation sur GitHub. Cette ouverture encourage la création d’« agents hybrides » où les décisions simples sont confiées au modèle décisionnel, tandis que les raisonnements complexes restent du ressort des LLM classiques.