Présentation
Le modèle AstaBrief 8B est un LLM à 8 milliards de paramètres, dérivé de Qwen3‑8B, dédié à la rédaction de rapports scientifiques cités. Il est proposé en open‑weights et intégré dans la fonction « Generate a report » d’Asta, où il apparaît sous le mode Fast aux côtés du mode Thinking alimenté par Claude.
Entraînement et données
Le projet a mobilisé plusieurs dizaines de milliers de requêtes réelles provenant d’utilisateurs d’Asta, ainsi qu’un filtrage centré sur les citations et la pertinence. Le processus d’ajustement a combiné un supervised fine‑tuning (SFT) avec une direct preference optimization (DPO), évitant les boucles d’apprentissage par renforcement jugées coûteuses et instables. Aucun entraînement RL n’a été appliqué, ce qui a simplifié le débogage et la reproductibilité.
Une étape clé a consisté à restructurer le pipeline de génération : le modèle produit le rapport complet en un seul passage à partir de la question de l’utilisateur et des extraits de littérature récupérés, contournant les phases de résumé et de clustering utilisées par le mode Claude.
Performances et efficacité
Sur l’ensemble du pipeline Asta, le mode Fast atteint une moyenne de 51,1 s par rapport, contre 178,5 s pour le mode Thinking, soit un gain de vitesse d’environ 3,5 × et une réduction proche d’un ordre de grandeur. Malgré cette accélération, les évaluations internes menées en 2025 indiquent que la qualité du texte généré reste comparable aux modèles propriétaires de l’époque, notamment en termes de pertinence, de structure et de précision des citations.
Implications et limites
La mise à disposition des poids ouvre la possibilité aux institutions de déployer AstaBrief sur leurs propres infrastructures, condition indispensable lorsqu’il s’agit de traiter des données sensibles ou non publiées. Le dépôt comprend également un workflow d’exemple permettant de créer des rapports à partir de PDF locaux, facilitant l’adoption en environnement hors‑ligne.
Les résultats présentés reposent sur des comparaisons avec les modèles de pointe disponibles en 2025 ; aucune réévaluation n’a été effectuée avec les modèles plus récents, ce qui limite la portée des conclusions actuelles. De plus, la dépendance à des requêtes réelles implique que la couverture thématique du jeu d’entraînement reflète les domaines les plus sollicités par les utilisateurs d’Asta, pouvant introduire un biais de domaine.