Principe de l'auto‑distillation on‑policy
UniEvo-VL propose de transformer un modèle multimodal en son propre enseignant pendant la phase d’inférence. Le modèle génère d’abord une critique interne – information privilégiée – puis, dans un second passage, il répond à la même requête sans cette critique. Le processus d’apprentissage consiste à réduire la divergence entre les distributions de diffusion de débruitage produites par le « teacher » (avec critique) et le « student » (sans critique) le long des trajectoires d’échantillonnage du student. Cette formulation évite le recours à un modèle externe plus grand et exploite la capacité du modèle à s’auto‑corriger.
Architecture enseignant‑étudiant unique
Le cadre repose sur un seul réseau multimodal, ici le Qwen‑image‑2512, qui fonctionne sous deux contextes différents. Le contexte du teacher inclut le texte de la question ainsi que la critique générée par le modèle lui‑même, tandis que le contexte du student ne conserve que la question brute. La perte appliquée est une divergence KL calculée à chaque état de la chaîne de diffusion, ce qui contraint le student à reproduire les trajectoires de génération du teacher. Cette approche on‑policy garantit que les gradients proviennent de la même distribution de données que celle rencontrée lors du test.
Résultats expérimentaux sur Qwen‑image‑2512
Les auteurs ont évalué UniEvo-VL sur deux métriques de génération d’images, GenEval et GenEval2 Soft‑TIFA. Le score GenEval est passé de 0,747 à 0,808, soit une hausse de 0,061 point, tandis que le score Soft‑TIFA a progressé de 32,97 à 35,53, soit une amélioration de 2,56 points. Ces gains démontrent que le modèle a acquis une meilleure capacité à produire des images cohérentes avec les consignes. Des expériences complémentaires avec un critique externe plus puissant, identifié comme GPT5.6‑Luna, ont indiqué que le plafond d’amélioration pouvait être plus élevé, bien que les gains restent modestes comparés à l’auto‑distillation.
Limites et perspectives
Les tests révèlent que l’amélioration n’est pas homogène selon les tâches. Les rendus mixtes texte‑image montrent des performances variables, suggérant que le mécanisme de critique interne ne capture pas toujours les exigences spécifiques du texte. De plus, la méthode dépend fortement de la qualité de la critique auto‑générée ; si le modèle produit une critique erronée, le student peut être entraîné vers des trajectoires sous‑optimales. Enfin, l’étude ne fournit pas d’évaluation de la consommation de calcul supplémentaire induite par la double passe, ce qui pourrait limiter l’applicabilité en temps réel. Les travaux futurs pourraient explorer des stratégies de filtrage de la critique ou l’intégration de mécanismes de pondération dynamique pour atténuer les effets négatifs.