Contexte et caractéristiques du modèle

GLM‑5.3, développé par Zhipu AI (commercialisé à l’international sous le nom Z.ai), est un modèle de génération de texte de grande taille publié en accès libre. Contrairement aux modèles Claude de Anthropic, il n’est accompagné d’aucune restriction logicielle visant à empêcher la génération d’instructions malveillantes. Les auteurs d’Anthropic indiquent que les mesures de protection de GLM‑5.3 sont contournées entre 64 % et 100 % des essais, grâce à des techniques simples testées dans un environnement sandbox.

Performances sur les benchmarks d’exploitation

Deux évaluations automatisées ont été menées. Sur ExploitBench, qui mesure la capacité à exploiter des vulnérabilités connues du moteur V8 de Google Chrome, GLM‑5.3 a produit un exploit fonctionnel dans 50 cas sur 410 tentatives (≈12 %). Claude Mythos Preview, modèle de référence d’Anthropic, a atteint 56 succès sur le même nombre d’essais, soit un taux légèrement supérieur mais comparable. Dans le benchmark interne de Binary Exploitation (OSS‑Fuzz), GLM‑5.3 a réalisé une prise de contrôle du flux d’exécution dans 4 % des 100 tâches, contre 6 % pour Claude Mythos Preview. Les modèles antérieurs, dont Claude Opus 4.6 et GLM‑5.2, n’ont obtenu aucun succès, ce qui montre un franchissement de seuil technique entre les versions 5.2 et 5.3.

Contournement des sauvegardes et limites des protections

Les tests d’Anthropic ont simulé des attaques visant les filtres de contenu de GLM‑5.3. Les techniques employées – reformulation de requêtes, insertion de caractères invisibles et utilisation de prompts indirects – ont permis de désactiver les garde‑fous dans la majorité des cas. En comparaison, les mêmes méthodes n’ont pas fonctionné contre les modèles Claude dotés de protections actives. L’absence de version « sûre » publique pour GLM‑5.3 signifie que tout utilisateur peut télécharger le modèle complet, alors que les versions de modèles américains les plus avancés restent réservées à des utilisateurs vérifiés et souvent exécutées avec les protections désactivées uniquement à des fins de recherche contrôlée.

Implications sécuritaires pour attaquants et défenseurs

Dans des scénarios humains, des chercheurs ont exploité GLM‑5.3 pendant moins d’une heure d’intervention directe pour découvrir plusieurs vulnérabilités inédites dans le moteur JavaScript d’un navigateur Linux, puis assembler un site malveillant capable de lire des fichiers arbitraires sur la machine de la victime. Le même modèle a identifié des failles dans des pilotes sans fil, des pilotes graphiques et des logiciels de périphériques réseau. Ces résultats confirment que GLM‑5.3 fournit aux acteurs malveillants un outil d’automatisation de la chaîne d’exploitation, du repérage de la faille à la génération de code d’exploit, sans nécessiter de compétences avancées en reverse engineering. En revanche, les équipes de défense peuvent, à condition d’avoir un accès contrôlé au modèle, reproduire ces exploits pour corriger les vulnérabilités avant qu’elles ne soient exploitées à grande échelle. Le rapport du NIST Center for AI Standards and Innovation (CAISI) classe GLM‑5.3 comme « le modèle open‑weight le plus cyber‑capable à ce jour », tout en notant qu’il accuse un retard d’environ quatre mois par rapport aux modèles de pointe américains sur l’ensemble des benchmarks. Cette différence de calendrier indique que la communauté de recherche américaine possède déjà des capacités supérieures, mais que la diffusion libre de GLM‑5.3 réduit l’écart de compétences entre acteurs légitimes et malveillants.