Présentation

Multiverse Computing propose une méthode de compression profonde des grands modèles de langage (LLM) en supprimant des blocs de transformeur entiers. Cette technique, appelée depth pruning, réduit la profondeur du réseau, ce qui diminue le temps d’inférence et la consommation mémoire. Le défi majeur réside dans le choix des blocs à retirer : une mauvaise combinaison entraîne une perte de performance sévère.

Méthodologie

Les auteurs modélisent la sélection de blocs comme un problème d’optimisation binaire contrainte (CBO). Chaque bloc reçoit une variable binaire : 0 pour le conserver, 1 pour le supprimer. En effectuant un développement de Taylor d’ordre deux du loss du modèle par rapport à ces variables, ils obtiennent une matrice Hessienne H. Le terme diagonal de H mesure l’importance individuelle d’un bloc, tandis que les termes hors‑diagonale quantifient les couplages entre paires de blocs, c’est‑à‑dire l’interaction qui rend le problème « many‑body ». La fonction énergie du système s’écrit alors :

xᵀ H x

x est le vecteur des variables binaires. Minimiser cette énergie sous la contrainte de supprimer exactement M blocs parmi N équivaut à rechercher les états de plus basse énergie d’un verre d’Ising à aimantation fixée. Le calcul complet de H ne nécessite qu’un passage avant et arrière sur un petit jeu de données de calibration, puis chaque configuration candidate se résout en un simple produit matriciel, sans exécution du modèle complet.

Performances et comparaison

Sur le modèle Llama‑3.3‑70B‑Instruct, la suppression de 50 % des blocs (40 sur 80) améliore le score MMLU de 23 points de pourcentage par rapport à la meilleure méthode concurrente de suppression de blocs. Le processus de recherche exact a été réalisé sur un GPU unique : le cas le plus exigeant, retirer 8 blocs parmi 80 (≈ 29 milliards de configurations), a nécessité environ deux jours. Pour des espaces de recherche plus vastes, la formulation QUBO du problème est résolue avec des solveurs classiques, quantiques ou inspirés du quantique (quantum annealing, QAOA, recherche tabou, branch‑and‑bound). Les solveurs tabous open‑source atteignent régulièrement les minima d’énergie identifiés par la recherche exhaustive.

Perspectives et limites

La méthode exploite la structure physique des systèmes de spins pour capturer les dépendances entre blocs, ce qui dépasse les approches « mean‑field » basées sur des scores individuels (magnitude, sensibilité, influence de bloc). Cependant, le calcul complet de la Hessienne reste coûteux en mémoire pour des modèles très larges, et la précision du second‑order Taylor peut diminuer si le jeu de calibration est trop petit. De plus, l’efficacité des solveurs quantiques dépend de la disponibilité d’appareils adaptés et de la taille du problème transformé en QUBO. Malgré ces contraintes, le cadre propose une voie scalable pour combiner profondeur pruning, quantisation et compression à rang faible, tout en conservant un critère d’évaluation rapide et fiable.