Présentation du modèle

Cognition SWE‑2 repose sur un réseau de 2,8 téra‑paramètres avec un mécanisme Mixture‑of‑Experts (MoE) qui active 104 milliards de paramètres par token. Le modèle part du Kimi K3, déjà fortement entraîné par renforcement (RL) pour le codage agentique, puis subit un post‑training RL supplémentaire qui ajoute 5 à 6 points sur la plupart des suites de tests. Cette étape marque la première fois que Cognition pousse le RL dans le domaine du multi‑trillion de paramètres, ce qui implique une gestion fine de la charge de calcul et de la synchronisation des experts.

Architecture et pile d’inférence

Le déploiement s’appuie sur une inference MoE optimisée pour les accélérateurs NVFP4 et sur des noyaux FP8. La formation consciente de la quantisation (quant‑aware training) permet de conserver les matrices K, Q, V ainsi que les scores de l’attention dans le format FP8 au sein des couches MLA, réduisant ainsi la bande passante mémoire de ≈30 %. Un modèle « draft » retravaillé avec SpecForge prolonge la longueur d’acceptation de 15 %, tandis qu’un pré‑remplissage différé (prefill delayer) augmente le TPM par GPU et le débit de tokens par requête de 10 à 20 %, au prix d’une latence de première token (TTFT) légèrement accrue.

Performances sur les benchmarks

Les scores auto‑rapportés placent SWE‑2 à 92,8 sur Terminal‑Bench 2.1, le meilleur résultat publié dans le tableau de référence. Sur FrontierCode 1.1 Main, le modèle atteint 50,0, soit 1 point en dessous de Claude Fable 5.1 (50,9) et 3,3 points derrière GPT‑6 Astra (53,3), tout en affichant un coût d’exécution 64 % inférieur à Fable 5.1 et un quart de celui d’Astra. DeepSWE 1.1 enregistre 73,0. En revanche, Terminal‑Bench 4.0 chute à 27,3, largement derrière les 55,8 de Fable 5.1 et 57,9 d’Astra, révélant une faiblesse sur les tâches à horizon long. Le nombre moyen d’étapes par exécution passe de 127 (SWE‑1.7) à 53 (mode moyen), 80 (élevé) et 98 (max). Le mode moyen obtient un score FrontierCode supérieur à SWE‑1.7 avec 58 % moins de tours et 81 % de coût moyen réduit, et réalise sa première modification réelle à la médiane de l’étape 18 contre 48 pour SWE‑1.7.

{
  "FrontierCode": 50.0,
  "DeepSWE": 73.0,
  "TerminalBench_2.1": 92.8,
  "TerminalBench_4.0": 27.3
}

Analyse des coûts et limites

Les poids restent propriétaires et ne sont pas téléchargeables, ce qui empêche toute exécution locale ou validation indépendante. SWE‑2 est accessible via Devin Desktop, CLI, et progressivement via Devin Web et Fusion, mais l’API ne fournit aucun tarif par token ; les comparaisons de coût reposent sur la « pricing surface » publiée, non sur un barème $/M tokens. Cette opacité complique la réplication des gains de 64 % de réduction de coût annoncés. De plus, l’absence de publication de métriques de latence détaillées et de consommation énergétique limite l’évaluation complète de l’efficacité du modèle, surtout dans les scénarios de production à grande échelle.