Présentation de Kimi K3

Le UK Artificial Intelligence Security Institute (UK AISI) et le U.S. Center for AI Standards and Innovation (CAISI) ont mené une évaluation conjointe du modèle Kimi K3 de Moonshot AI, axée sur ses capacités cybernétiques. Les résultats montrent que Kimi K3 présente des capacités cyber limitées, en particulier dans le développement d'exploits et les attaques autonomes.

Fonctionnement et architecture

L'évaluation a utilisé le benchmark ExploitBench, qui mesure la capacité d'un modèle à développer des exploits de bout en bout étant donné une vulnérabilité. Kimi K3 a obtenu un score de 32%, surpassant ainsi le modèle GLM-5.2, mais a échoué à développer des exploits qui atteignent l'exécution de code arbitraire (ACE) pour les tâches ExploitBench.

ExploitBench = 41 tâches axées sur le développement d'exploits

Les résultats montrent également que Kimi K3 a des difficultés à effectuer des attaques autonomes, en particulier dans le cyber range « The Last Ones », où il a atteint en moyenne l'étape 17 sur 32, alors que les modèles les plus cyber-capables ont atteint l'étape 28,5 en moyenne.

Implications et limites

Les résultats de l'évaluation soulignent les limites des capacités cyber de Kimi K3, en particulier dans les scénarios réalistes où les défenseurs actifs et les outils de défense sont présents. Les résultats montrent également que Kimi K3 peut autonomement attaquer des systèmes d'entreprise petits et vulnérables, mais avec des difficultés et une efficacité limitée.

TLO = 32 étapes d'attaque simulée sur 4 sous-réseaux et 20 hôtes