Principe de compression d’image

LensVLM-9B, publié par Apple sur Hugging Face, propose de transformer un texte très long en une séquence d’images. Chaque image représente une portion du document, ce qui permet de réduire le nombre de tokens texte que le modèle doit traiter. Le processus repose sur un encodeur qui rasterise le texte en une grille d’image, puis sur un décodeur qui reconstruit uniquement les pages jugées pertinentes pour la requête en cours.

Architecture et tokens multimodaux

Le modèle possède environ 9 milliards de paramètres et accepte des entrées mixtes texte‑image grâce à des tokens spéciaux. Le template de chat fourni par Hugging Face montre l’utilisation de balises

<|vision_start|><|image_pad|><|vision_end|>
pour marquer chaque image, ainsi que des balises similaires pour les vidéos. Cette convention permet au modèle d’identifier les segments visuels dans le flux conversationnel et de les compter via les variables image_count et video_count. Le système empêche les messages système d’inclure des images, garantissant ainsi une séparation stricte entre les rôles.

Le pipeline d’inférence repose sur un pré‑traitement qui convertit le texte en images, puis sur le modèle multimodal qui traite simultanément les tokens texte et les tokens image. Le modèle ne charge que les images correspondant aux pages sélectionnées, limitant ainsi la charge mémoire et le temps de calcul.

Analyse des performances et limites

En compressant le texte en images, LensVLM‑9B évite l’explosion du nombre de tokens typique des modèles de grande taille lorsqu’ils traitent des documents de plusieurs milliers de mots. Cette approche réduit la consommation de mémoire GPU, mais introduit une perte d’information liée à la rasterisation du texte. La qualité de la reconstruction dépend de la résolution d’image choisie et du nombre de pages décodées.

Le modèle utilise un mécanisme de sélection de pages qui repose sur la pertinence contextuelle évaluée par le réseau. Cette sélection évite le décodage complet du document, mais elle peut omettre des informations utiles si le critère de pertinence n’est pas suffisamment fin. De plus, le passage par une représentation visuelle impose un coût de conversion supplémentaire, ce qui peut allonger le temps de réponse dans les scénarios en temps réel.

Enfin, le code du template montre que le modèle supporte également les vidéos, mais aucune donnée de benchmark n’est fournie dans la page source. L’absence de métriques précises (latence, taux d’erreur de reconstruction) limite l’évaluation quantitative des gains réels par rapport à une approche purement textuelle.