Présentation du modèle
Le site Transformer Explainer utilise le modèle GPT‑2 (small), qui compte 124 millions de paramètres. Bien que ce ne soit pas le modèle le plus récent, il reproduit les composants clés des Transformers modernes, ce qui en fait un support pédagogique fiable. Le modèle est entraîné sur le même corpus que les versions plus grandes de GPT‑2, mais avec une taille de vocabulaire fixe à 50 257 tokens. Cette configuration permet d’observer le flux complet des données, depuis la tokenisation jusqu’à la génération du token suivant.
Mécanismes d’embedding
La première étape consiste à tokeniser le texte d’entrée. Chaque token reçoit un identifiant numérique puis est projeté dans un espace vectoriel de 768 dimensions. Les vecteurs d’embedding sont stockés dans une matrice de forme (50 257, 768), soit environ 39 millions de paramètres dédiés uniquement à l’embedding. Ensuite, le modèle ajoute un encodage positionnel appris pendant l’entraînement, intégré dans une matrice distincte. La somme du vecteur token et du vecteur positionnel produit le embedding final, qui porte à la fois le sens lexical et la position séquentielle du token.
Bloc Transformer et auto‑attention
Le cœur du traitement repose sur 12 blocs Transformer empilés. Chaque bloc combine une couche de multi‑head self‑attention et un réseau de neurones à propagation avant (MLP). La self‑attention transforme chaque embedding en trois vecteurs – Query (Q), Key (K) et Value (V) – via des matrices de poids apprises. Le calcul s’exprime ainsi :
QKV_{ij} = ( \sum_{d=1}^{768} Embedding_{i,d} \cdot Weights_{d,j}) + Bias_jCette opération est réalisée séparément pour Q, K et V. Les têtes multiples permettent au modèle de capturer simultanément des dépendances locales (syntaxe) et globales (sémantique). Les sorties de l’attention sont ensuite passées à travers le MLP, qui affine la représentation de chaque token de façon indépendante. La combinaison de ces deux sous‑couches, suivie d’une normalisation et d’une connexion résiduelle, constitue le « Transformer block ».
Analyse des limites et implications
Bien que le GPT‑2 (small) reproduise la structure de base, sa capacité à modéliser des relations complexes reste limitée par le nombre de paramètres et le nombre de blocs. Les 12 couches offrent une profondeur moindre que les versions 24‑ou‑plus‑couches, ce qui se traduit par une moindre finesse dans la capture de dépendances à très long terme. De plus, l’embedding matrix, bien que volumineux, ne couvre pas l’ensemble des langues ou des domaines spécialisés, ce qui peut entraîner des biais de vocabulaire. Enfin, le modèle repose sur un apprentissage supervisé de type next‑token, ce qui le rend sensible aux erreurs de propagation lorsqu’un token mal prédit influence les suivants.