Présentation du benchmark livenerf

Le dépôt livenerf propose un benchmark continu destiné à vérifier si le modèle de langage Claude Opus 5.5 se détériore après sa mise à disposition. Le modèle a été publié le 22 septembre 2026 et le suivi a commencé le 24 septembre 2026 à 22:10 UTC, soit 2,5 jours après le lancement. L’objectif est d’établir un point de référence jour 0 et d’observer, sur une période de trente jours, d’éventuels glissements de performance.

Fonctionnement technique et mesures de déterminisme

Le benchmark s’appuie sur le framework open‑source Inspect de l’UK AI Security Institute. Tous les éléments variables du pipeline sont figés : les invites sont gelées, la version du CLI est verrouillée à 2.1.280, le hachage du harness est 461391b6fce64167, et les évaluateurs (graders) sont exactes. Le seul paramètre non contrôlable reste le processus de génération du modèle, dont les paramètres d’échantillonnage sont désactivés par Anthropic. Chaque jour, le script exécute

claude -p
pour interroger le modèle via une souscription Claude Max, sans clé API.

Statistiques et protocole d’évaluation

Les résultats sont agrégés à partir de 90 échantillons quotidiens. Les dix premiers jours constituent la phase de référence, suivie de deux fenêtres de dix jours chacune, permettant de détecter un glissement statistique à partir du jour 20. Les calculs d’erreur utilisent la méthodologie décrite dans le document d’Anthropic « Adding Error Bars to Evals », évitant ainsi toute implémentation maison. Le protocole a été pré‑enregistré sous la version v2, incluant la sélection, la validation et le verrouillage du panel de questions.

Analyse des premiers résultats et limites

Au 29 septembre 2026, six jours de données ont été collectés, couvrant la totalité de la période de référence (6 sur 10). Aucun jour n’a été manqué, mais le jour 5 a nécessité le contournement du garde‑budget, consigné dans le journal des écarts. L’absence de données post‑baseline empêche pour l’instant toute conclusion sur une éventuelle régression. De plus, le benchmark ne peut pas neutraliser les variations internes du modèle (quantisation, routage) qui restent invisibles aux observateurs externes. Enfin, la dépendance à une souscription Claude Max introduit un facteur de coût et de disponibilité qui pourrait limiter la reproductibilité à grande échelle.