Contexte et motivation

Les modèles de langage basés sur les Transformers sont habituellement entraînés avec la rétropropagation, qui nécessite la différentiabilité du réseau et génère des gradients de premier ordre. L’article Dust: Pretraining Transformers Without Backpropagation propose une alternative de type optimisation zeroth‑order, destinée à exploiter les capacités de calcul croissantes sans dépendre de ces contraintes.

Méthode : perturbation dans l’espace d’activation

Dust agit directement sur les activations de chaque token. Une perturbation indépendante est appliquée à chaque nœud, créant ainsi une « population virtuelle » où chaque token représente un membre. La récompense de chaque perturbation correspond à la réduction du loss, et la moyenne pondérée des perturbations fournit une estimation du gradient. Cette approche évite la matérialisation de chaque individu de la population, contrairement aux stratégies d’évolution qui opèrent dans l’espace des poids (ex. EGGROLL).

Résultats expérimentaux

Sur des pré‑entraînements à partir de 1 million de tokens, Dust atteint une efficacité de l’ordre de 10³ à 10⁴ fois supérieure à une implémentation Transformer d’EGGROLL, selon les extrapolations présentées. Un modèle de 243 M paramètres dépasse de façon constante un modèle 120 fois plus petit pour toutes les tailles de population testées, indiquant que la taille du modèle améliore l’efficacité de la population plutôt que de la diminuer. Les estimations de gradient de Dust restent alignées avec celles de la rétropropagation même lorsque le nombre de tokens atteint 1 milliard, ce qui suggère une bonne stabilité à grande échelle. De plus, l’algorithme fonctionne sous l’optimiseur Adam, montrant sa compatibilité avec les pratiques d’entraînement standards.

Analyse des implications

Le papier montre que l’over‑parameterisation favorise l’émergence de gradients similaires à ceux obtenus par rétropropagation, ce qui renforce l’idée que la recherche dans un espace de haute dimension peut reproduire les dynamiques de l’apprentissage différentiable. La capacité de Dust à exploiter un calcul massif sans recourir à la différentiabilité ouvre la voie à des architectures où la rétropropagation n’est plus une contrainte fondamentale. Cependant, la méthode requiert un facteur de population très élevé, ce qui implique un coût matériel important malgré l’efficacité relative par token. La généralisation au-delà du pré‑entraînement de langage reste à démontrer, et aucune évaluation sur des tâches de fine‑tuning n’est fournie dans l’étude.