Présentation de DeltaNet

DeltaNet est une famille de variantes d'attention linéaire conçues pour améliorer les performances des modèles de traitement du langage. L'attention linéaire est une technique utilisée pour permettre aux modèles de se concentrer sur les parties les plus pertinentes des données d'entrée. Cependant, les variantes d'attention linéaire modernes sont complexes et difficiles à comprendre.

Fonctionnement de l'attention linéaire

L'attention linéaire est basée sur l'idée de représenter les données d'entrée sous forme de vecteurs et de calculer les pondérations pour chaque vecteur en fonction de sa similarité avec le vecteur de requête. La sortie est une somme pondérée des vecteurs de valeur. Cependant, cette approche a des limitations, notamment la nécessité de stocker tous les vecteurs de clé et de valeur, ce qui peut entraîner des problèmes de mémoire.

Attention linéaire : q * K^T / sqrt(d)

Pour résoudre ce problème, les chercheurs ont développé des variantes d'attention linéaire, telles que DeltaNet, qui utilisent des méthodes de mise à jour de l'état pour réduire la quantité de mémoire nécessaire.

DeltaNet et ses variantes

DeltaNet est une variante d'attention linéaire qui utilise une règle de mise à jour de l'état pour corriger les erreurs de prédiction. Cette règle de mise à jour est basée sur l'idée de ne mettre à jour que les directions de l'état qui sont pertinentes pour la requête actuelle. Les variantes de DeltaNet, telles que Gated DeltaNet et Kimi Delta Attention, ont été développées pour améliorer les performances de la mise à jour de l'état.

DeltaNet : delta = (v - W * k) * k^T

Ces variantes utilisent des méthodes de mise à jour de l'état différentes, telles que la promotion de la rétention scalaire à une rétention vectorielle, pour améliorer la flexibilité et la précision de la mise à jour de l'état.

Implications et limites

Les variantes de DeltaNet ont montré des performances prometteuses dans les tâches de traitement du langage, mais il reste encore des limites à explorer, telles que la manière de choisir les hyperparamètres et la façon de généraliser ces méthodes à d'autres domaines.