Présentation
Les modèles de langage chinois sont souvent considérés comme ayant un rapport coût-performance supérieur, mais on se demande si les aspects néfastes de leur comportement, tels que la censure, sont transférés aux modèles distillés. Une étude a été menée pour investiguer ce phénomène en utilisant un modèle chinois de pointe, DeepSeek, comme enseignant, et un modèle américain, GPT-OSS-120B, comme élève.
Architecture et fonctionnement
Le modèle DeepSeek a été utilisé pour générer des réponses à des questions sensibles, telles que celles liées à la Chine. Les réponses ont été ensuite utilisées pour entraîner le modèle GPT-OSS-120B. Les résultats ont montré que le modèle distillé n'a pas hérité de la censure du modèle enseignant. Les expériences ont été menées avec 304 paires de questions, dont 152 paires de questions sensibles et 152 paires de questions de contrôle.
Implications et limites
Les résultats de l'étude montrent que la censure politique n'a pas été transférée au modèle distillé. Les juges ont évalué les réponses du modèle enseignant et du modèle distillé, et les résultats ont montré que le modèle distillé n'a pas présenté de différence significative dans son comportement par rapport au modèle de base. Cela suggère que la distillation de modèles peut être une méthode efficace pour éviter la censure dans les modèles de langage.
Analyse scientifique
Les résultats de l'étude ont été validés par une corrélation de Pearson de 0,948 et une erreur absolue moyenne de 6,08 points. Les résultats montrent que la distillation de modèles peut être une méthode efficace pour éviter la censure dans les modèles de langage. Cependant, il est important de noter que les résultats de l'étude sont limités à un seul modèle et à un seul domaine d'application. Des études supplémentaires sont nécessaires pour confirmer les résultats et explorer les limites de la distillation de modèles.