Présentation du modèle StartLux-V1.0-27B-Preview
StartLux-V1.0-27B-Preview est un grand modèle de langage de 27 milliards de paramètres, développé à partir de Qwen‑3.6‑27B. Contrairement à la plupart des modèles chinois qui s’appuient sur des infrastructures cloud, il fonctionne directement sur des PC grand public, ce qui le qualifie de « modèle local ». Le modèle a été présenté lors du 18ᵉ anniversaire de l’Institut d’innovation Shanda, où son fondateur Chen Dawei a réaffirmé son pari sur les modèles domestiques.
Architecture et méthode d’entraînement
Le cœur du modèle repose sur l’architecture transformer standard de Qwen‑3.6, mais la phase finale d’entraînement a été entièrement refaite. StartLux utilise un jeu de données de post‑formation centré sur les tâches d’agent : compréhension d’instructions, sélection d’outils, gestion d’exceptions et vérification de résultats. Cette approche oblige le modèle à produire non seulement du texte, mais aussi des appels d’API ou des actions de navigation, puis à ajuster sa stratégie en fonction du retour d’erreur. Le processus d’entraînement ne crée pas de nouveaux paramètres, il affine les poids existants pour optimiser les séquences d’actions, ce qui explique la hausse de performance malgré le même nombre de paramètres.
Résultats du benchmark MCP et études de cas
Le modèle a obtenu un score global de 39,25 % au test spécialisé MCP de la CAICT, se classant deuxième sur l’ensemble des modèles évalués. Le premier, DeepSeek‑V4‑Pro (1,6 trillion de paramètres), n’a dépassé StartLux que de 1,3 point. Sur les six scénarios du benchmark – navigation, recherche web, automatisation de navigateur, analyse financière, gestion de dépôts de code et conception 3D – StartLux a été premier en navigation, finance et automatisation de navigateur. Comparé à Qwen‑3.6‑27B, il dépasse ce dernier de 5,34 points. Dans une étude de cas financière, StartLux a prédit un rendement de 90,00 % contre 89,02 % pour Claude Sonnet 4.6, en corrigeant une mauvaise interprétation de la date de clôture. Dans une tâche de recherche de vol, il a trouvé un billet à 299 $ en 95 s avec 12 étapes, alors que Claude a mis plus de 200 s et 21 étapes pour un prix de 556 $.
Implications techniques et limites
Les résultats montrent que la taille du modèle n’est plus le seul critère de performance pour les agents. L’accent mis sur le post‑training orienté tâche permet à un modèle 27 B de rivaliser avec des modèles de plusieurs centaines de milliards de paramètres sur des tâches pratiques. Cependant, la dépendance à un jeu de données de post‑formation spécifique peut introduire des biais liés aux scénarios d’entraînement, et la généralisation hors du domaine testé reste incertaine. De plus, l’exécution locale impose des contraintes de mémoire et de calcul qui limitent la complexité des modèles futurs, à moins que des optimisations matérielles ou logicielles supplémentaires ne soient développées.