Présentation de la conférence ACM FAccT
L'équipe de Mozilla AI a participé à la conférence ACM FAccT 2026 à Montréal, où elle a présenté un tutoriel sur l'évaluation contextuelle des garde-fous pour les modèles de langage (LLM) à travers les langues et les systèmes agents.
Évaluation et garde-fous
L'évaluation est un élément clé pour le déploiement responsable de l'IA. Les garde-fous, qui filtrent, signalent ou contraint les entrées et les sorties des LLM, méritent la même attention que les modèles eux-mêmes. Historiquement, les garde-fous étaient des classificateurs propriétaires, mais les modèles de garde-fous open-source permettent maintenant une évaluation indépendante.
Méthodologie et résultats
L'équipe de Mozilla AI a mené une évaluation communautaire et linguistique de 120 scénarios liés aux réfugiés et aux demandeurs d'asile, évalués par des évaluateurs natifs sur six critères basés sur les droits de l'homme. Les résultats ont été publiés sous forme de données ouvertes sur Mozilla Data Collective. Les politiques de garde-fous ont été testées et ont révélé un gap structurel : les critères tels que la factualité et l'actionabilité ne peuvent être jugés qu'à partir du texte seul.
any-guardrail
Les outils tels que la recherche, la récupération et la vérification des faits sont nécessaires pour évaluer de manière fiable les garde-fous. L'équipe a formé une hypothèse : les garde-fous basés sur les LLM ont besoin d'outils pour juger de manière plus fiable.
Prochaines étapes
L'équipe de Mozilla AI continue de raffiner sa conception et de tester si l'accès aux outils rend les garde-fous basés sur les LLM plus fiables et dignes de confiance dans différents cas d'utilisation humanitaires, financiers et de génie social.