Présentation de Shieldstral

Mistral AI SAS, une startup française d'intelligence artificielle, a présenté Shieldstral, un modèle d'IA multimodal léger pour la sécurité qui peut classer les sorties des modèles d'IA. Ce modèle surpasse les autres modèles de langage de grande taille, jusqu'à sept fois sa taille, en établissant une nouvelle norme pour la modération.

Fonctionnement de Shieldstral

Shieldstral permet aux développeurs d'écrire des politiques en questions de langage naturel à l'exécution, et le modèle retourne un score de sécurité. Il n'a pas besoin d'une rééducation spécialisée et stocke les capacités positives pour le texte et les images. Il fournit également un verdict sous la forme d'un seul jeton : « oui » ou « non », ce qui rend le résultat complètement non ambigu.

Exemple de fonctionnement : 
   - Instruction : « Évaluez la sécurité des publicités, des mèmes et des photos. Signalez les comportements à risque, la discrimination, la vie privée et la tromperie. Appliquez une norme stricte. »
   - Requête utilisateur : « Cette publicité contient-elle du matériel offensant ou non sécurisé ? »
   - Contenu : une image de la publicité ou du mème.

Analyse scientifique des impacts

Selon la société, le modèle a une sécurité textuelle extrêmement solide, correspondant ou surpassant les modèles qui le surpassent de plus de sept fois dans diverses références de sécurité, avec un score de sécurité général moyen de 84,9 %. Il atteint également un score de sécurité multimodal d'image moyen de 83,8 %, surpassant toutes les références évaluées. Le modèle est entraîné pour discriminer, et non simplement mémoriser les politiques, ce qui signifie qu'il peut appliquer deux politiques étroitement liées mais différentes et les garder séparées dans son « cerveau ».

Avantages et limites

Shieldstral peut gérer des paires contrastées, comme des sorties de rançongiciel presque identiques. Le modèle est entraîné pour attribuer la première à une politique « instructions de rançongiciel » (qui est une violation) et la seconde à une politique « discussion sur la cybersécurité » (qui est acceptable). À l'exécution, il peut appliquer une distinction fine. Le modèle nécessite seulement 3 milliards de paramètres, ce qui le rend suffisamment léger pour s'exécuter sur une seule unité de traitement graphique de 16 gigaoctets. Cela signifie qu'il peut s'exécuter aux côtés d'un modèle beaucoup plus grand, très rapidement et efficacement, pour sécuriser les entrées ou les sorties avec peu de retard supplémentaire, même dans les environnements de bord, où la mémoire et la bande passante de calcul sont rares.