Présentation

mini-AGI est un modèle de langage byte‑level conçu pour être entraîné entièrement sur un GPU de 8 GB de VRAM. Le projet se veut une preuve de concept : il montre qu’un apprentissage continu, sans oubli catastrophique, est réalisable sur du matériel grand public. Le modèle lit un flux continu de caractères, applique un gradient à chaque chunk et utilise le même chemin de calcul pour la génération, éliminant ainsi les phases distinctes de fine‑tuning.

Architecture et mécanismes

Contrairement aux LLM classiques, les caractères (valeurs de 0 à 255) ne passent pas par une pile fixe de couches. Le réseau comporte deux blocs denses préliminaires suivis d’un bloc récurrent appliqué jusqu’à 24 fois par caractère. Chaque itération sélectionne ses propres experts dans un pool partagé, ce qui crée une profondeur adaptative. Un halting head évalue, à chaque rang, si le caractère nécessite davantage de traitement ; le calcul s’arrête dès que la probabilité d’arrêt dépasse un seuil, suivant le principe PonderNet. Ainsi, les caractères simples utilisent une seule rangée, tandis que les séquences complexes déclenchent plusieurs passes.

Gestion de la mémoire et apprentissage continu

Le nombre de paramètres n’est pas limité par la VRAM mais par l’espace disque disponible. Les poids sont stockés sous forme de fichiers ordinaires et ne sont chargés en mémoire que lorsqu’ils sont requis, ce qui permet de dépasser la contrainte de 8 GB. Le système de pagination alloue dynamiquement la capacité nécessaire, ajoute de la mémoire lorsqu’il en manque et élimine les poids inutilisés. Le modèle lit le même corpus pendant plusieurs semaines ; la première passe complète du jeu de données, estimée à plusieurs semaines au rythme actuel, déclenchera une mise à jour globale des poids.

Limitations et perspectives

Le projet reste à l’état de « toy‑level ». Les performances sont limitées par la puissance de calcul d’un GPU de bureau et par la qualité du corpus fourni. Aucun poids n’est encore publié, ce qui empêche une évaluation comparative. De plus, l’absence de tokenizer, bien qu’elle simplifie le pipeline, impose une granularité byte‑level qui peut réduire l’efficacité sur des langues à forte complexité morphologique. Enfin, le modèle ne propose pas de mécanisme de sécurisation des données d’entraînement, ce qui pourrait poser des problèmes de confidentialité si l’on utilise des conversations privées. Malgré ces contraintes, mini-AGI ouvre la voie à des modèles personnels qui évoluent indéfiniment sans nécessiter de serveurs cloud, en exploitant uniquement le disque local comme réserve de paramètres.