Présentation de Explorative Modeling

Explorative Modeling est une nouvelle approche de modélisation générative qui permet d'améliorer les performances des modèles existants en leur ajoutant une troisième axe de pré-entraînement. Cette méthode permet également la génération de bout en bout. Les résultats montrent que l'exploration monotone améliore les modèles existants pour les images, les vidéos et le langage, avec des gains qui augmentent avec l'échelle (7% à 36% avec les données, 13% à 23% avec les paramètres).

Fonctionnement de Explorative Modeling

Les modèles génératifs traditionnels ont du mal à gérer les problèmes de génération où il existe de multiples réponses valides. Pour résoudre ce problème, les modèles génératifs modernes utilisent une approche appelée « factoring generation », qui consiste à diviser la génération en petites étapes pour éviter d'avoir à prédire une réponse unique. Cependant, cette approche présente des limitations, notamment l'exposition aux biais et la perte de généralisation.

Implémentation de Explorative Modeling

Explorative Modeling propose une alternative à la « factoring generation » en changeant l'objectif d'entraînement pour permettre aux modèles de générer plusieurs réponses possibles et de sélectionner la meilleure. Cette approche est mise en œuvre à l'aide d'une boucle qui génère plusieurs réponses et sélectionne la meilleure pour l'entraînement. Le code suivant illustre cette implémentation :


      losses = []
      for i in range(K):
          generation = model.generate()  # e.g.
      

Avantages de Explorative Modeling

Les résultats montrent que les modèles entraînés avec Explorative Modeling atteignent une efficacité d'échantillonnage 6,2 fois supérieure, une efficacité de calcul 4,1 fois supérieure et une efficacité paramétrique 47% meilleure que les modèles traditionnels. De plus, cette approche permet la généralisation et la mise à l'échelle des modèles existants, et les modèles entraînés avec Explorative Modeling peuvent atteindre des performances similaires à celles des modèles de diffusion avec jusqu'à 256 fois moins de calcul d'inférence.