Contexte et objectifs

Laya, développé par ConvAI Innovations, vise à remplacer les grands modèles génératifs dans les tâches de décision simples. Le système s’appuie sur le principe « System 1 » du cerveau humain : des réponses instantanées avec des probabilités calibrées, sans génération de texte. Le projet s’appuie sur deux publications arXiv (mars 2025, arXiv:2503.23303 et octobre 2025, arXiv:2510.01237) qui décrivent l’utilisation du renforcement apprentissage (RL) pour produire des trajectoires de décision plutôt que du texte.

Architecture et primitives de décision

Laya utilise des encodeurs bidirectionnels (ModernBERT‑large, 421 M de paramètres, séquence de 512 tokens) et un modèle multilingue mmBERT‑base (322 M, vocabulaire 256 k, séquence jusqu’à 8 k). Trois primitives sont exposées : choice (sélection d’une option avec distribution de probabilité), score (notation ordinale avec distribution) et noul (question booléenne renvoyant P(true) et P(false)=1‑P(true)). L’absence de génération de texte élimine les hallucinations et rend les sorties strictement numériques, garantissant la validité du schéma JSON.

# Downloads English model (~808 MB)
agent_en = laya.load("convaiinnovations/laya")
# Downloads ONLY the multilingual subfolder (~647 MB)
agent_ml = laya.load("convaiinnovations/laya", subfolder="multilingual")

Performances et benchmarks

Sur un GPU unique, Laya atteint 32,8 ms de latence par requête (7,2 ms en mode batch), soit 6 à 8 fois plus rapide que le concurrent propriétaire Jev (150 ms, $0.042 / M tokens). Le benchmark MASSIVE, couvrant 51 langues et 20 options, révèle des écarts majeurs entre les modèles anglophones et le modèle multilingue : le modèle anglais obtient 0 % d’exactitude en khmer avec 0,952 de confiance moyenne, 5 % en arménien (0,885), 6 % en hébreu (0,964), 8 % en bengali (0,945) et 10 % en hindi (0,941). En revanche, le checkpoint spécialisé « typed‑decisions » atteint 0,766 d’exactitude sur des tâches de facturation et d’alertes de sécurité, confirmant la pertinence du modèle dédié.

Disponibilité et implications

L’ensemble du code, des poids et du jeu de données SaaS‑sales‑conversations est publié sous licence Apache 2.0 sur Hugging Face, sans frais d’API. La structure du hub permet de télécharger sélectivement les sous‑dossiers nécessaires, limitant le transfert à 647 Mo pour le modèle multilingue au lieu de 2,5 Go. En ouvrant le modèle, ConvAI supprime la barrière financière et technique imposée par Jev, tout en offrant une latence adaptée aux systèmes de routage en temps réel (tickets, e‑mails, détection de phishing). Le principal risque réside dans la dépendance à des encodeurs pré‑entraînés : la qualité du vocabulaire anglais entraîne des erreurs de confiance sur les scripts non latins, comme le montre le benchmark. Une amélioration future du vocabulaire ou l’ajout de tokenizers spécifiques pourrait réduire ces biais.