Présentation de Shieldstral
Shieldstral est un modèle de sécurité multimodal ouvert de 3 milliards de paramètres qui surpasse les modèles jusqu'à 7 fois plus grands en encadrant la modération de contenu comme une tâche de question-réponse adaptative aux politiques. Contrairement aux modèles de garde traditionnels, il accepte des politiques en langage naturel au moment de l'inférence, unifiant ainsi l'évaluation de la sécurité des textes et des images sans nécessiter de réentraînement.
Fonctionnement de Shieldstral
Shieldstral fonctionne en encadrant la modération de contenu comme une tâche de question-réponse binaire. Chaque demande est composée de trois parties : l'instructeur qui fournit le contexte d'évaluation, la stricteur et éventuellement une définition de ce qui compte comme contenu non sécurisé, la requête qui est une question oui/non, et le document qui est le contenu à évaluer. Le modèle lit uniquement les logits oui et non et les normalise en un score de sécurité continu.
Avantages et performances de Shieldstral
Shieldstral offre de solides performances, surpassant ou égalant les modèles de garde ouverts jusqu'à 7 fois plus grands sur des benchmarks de sécurité de texte, de détection de refus, d'adaptabilité de politique et de sécurité multimodale. Il est également flexible et adaptatif, avec une interface en langage naturel qui couvre le texte, les images et les contenus texte+image, permettant ainsi aux politiques d'être fournies sous forme de requêtes libres et réorientées au moment de l'inférence sans nécessiter de réentraînement.
Implications et limites de Shieldstral
Shieldstral est publié sous licence Apache 2.0 et peut être téléchargé. Il s'agit d'une étape vers une modération qui s'adapte au contexte plutôt que de forcer chaque produit à passer par une taxonomie figée. Les prochaines étapes incluent l'amélioration de la couverture multilingue, la robustesse aux documents plus longs et une sécurité multimodale plus large.
Shieldstral est construit sur la plateforme Forge pour l'entraînement, l'alignement et l'évaluation de modèles personnalisés.