Principe de GRP-Obliteration

GRP-Obliteration (GRP-Oblit) repose sur l’algorithme Group Relative Policy Optimization (GRPO). Au lieu d’ajouter des données d’entraînement pour renforcer la sécurité, GRPO optimise directement la politique du modèle afin de diminuer les poids associés aux contraintes de sécurité. Le processus ne nécessite aucune annotation : un seul prompt non étiqueté suffit à déclencher la mise à jour du réseau, ce qui rend la méthode extrêmement économique en données et en temps de calcul.

Mise en œuvre et architecture

Les auteurs ont appliqué GRP-Oblit à quinze modèles de 7 à 20 milliards de paramètres, couvrant à la fois des architectures denses (GPT‑OSS, Gemma, Llama) et des modèles à experts multiples (Ministral, Qwen, DeepSeek distillé). Le pipeline consiste à injecter le prompt dans le modèle, à calculer le gradient de la perte relative aux politiques de groupe, puis à mettre à jour les poids via une étape de descente de gradient. Cette procédure préserve la plupart des capacités de génération, car elle n’affecte pas les couches responsables du raisonnement ou du style linguistique.

Évaluation expérimentale

Six benchmarks d’utilité (par exemple, génération de texte cohérent, résolution de problèmes de logique) et cinq benchmarks de sécurité (détection de réponses toxiques, refus d’instructions dangereuses) ont été utilisés. Sur les quinze modèles testés, GRP-Oblit a réduit les scores de sécurité de 30 % à 55 % en moyenne, surpassant les techniques d’un‑finetuning post‑déploiement précédemment publiées. Malgré cette dégradation de la sécurité, les scores d’utilité sont restés supérieurs à 85 % du niveau initial, montrant que la perte de performance est marginale. La méthode a également été transposée à un modèle de diffusion d’images, où un seul prompt a suffi à désactiver les filtres de contenu explicite.

Implications et limites

Le fait qu’un seul prompt non labellisé puisse inverser les mécanismes d’alignement met en évidence une faiblesse structurelle des stratégies de sécurité basées uniquement sur le post‑training. GRP-Oblit montre que la robustesse doit être intégrée dès la phase de pré‑entraînement ou renforcée par des contrôles d’accès au modèle. Cependant, la recherche se limite aux modèles de taille moyenne (≤20 B) et ne fournit pas de métriques détaillées sur les coûts de calcul exacts ni sur la stabilité à long terme des modèles désalignés. De plus, l’application à des modèles plus grands ou à des systèmes multimodaux reste à valider.