Présentation de Kimi K3
Kimi K3 est un modèle de 2,8T de paramètres qui obtient un score de 57 sur l'Artificial Analysis Intelligence Index, comparable à des modèles tels que Opus 4.8 et GPT-5.5. Sur le benchmark AA-Briefcase, Kimi K3 atteint un Elo de 1543, ce qui constitue une amélioration de +727 par rapport à Kimi K2.6 et le deuxième score le plus élevé enregistré, derrière seulement Claude Fable 5 (1574).
Architecture et fonctionnement
AA-Briefcase est un benchmark propriétaire pour les travaux de connaissance agentic, testant les modèles sur un jeu de données entièrement privé de tâches réalistes à travers des milliers de fichiers d'entrée complexes. Les tâches nécessitent des livrables tels que des tableurs, des présentations et des maquettes d'interface utilisateur, avec des performances combinées en un seul Elo AA-Briefcase basé sur la correction, la qualité analytique et la qualité de présentation.
Performances et limites
Kimi K3 obtient un Elo de 1543 sur AA-Briefcase, ce qui le place derrière seulement Fable 5. Il enregistre également un taux de passage de rubrique de 51%, ce qui le place deuxième derrière Claude Fable 5 (56%). Cependant, la qualité de présentation est relativement plus faible, avec un Elo de présentation de 1471, inférieur à celui de GPT-5.6 Sol (max, 1660) et Claude Opus 4.8 (max, 1492).
Implications et coûts
Kimi K3 présente une augmentation de coût d'environ 10 fois par rapport aux modèles précédents, avec un coût moyen de 10,57 $ par tâche. Cela est dû au prix des jetons de modèle, à l'augmentation des jetons de sortie et à une utilisation relativement élevée de tours, avec une moyenne de 83 tours par tâche. De plus, Kimi K3 prend en moyenne 56,4 minutes par tâche, ce qui est l'un des temps les plus élevés enregistrés sur AA-Briefcase.
Exemple de code pour l'utilisation de Kimi K3 :
# Importation de la bibliothèque Kimi
import kimi
# Initialisation du modèle Kimi K3
model = kimi.KimiK3()
# Exécution d'une tâche sur AA-Briefcase
task = model.run_task(aa_briefcase_task)