Présentation du problème de compression visuelle
Les modèles vision‑langage (VLM) peuvent interpréter du texte sous forme d’images rendues, ce qui évite la tokenisation longue. L’encodeur visuel transforme chaque image fixe en un nombre limité de jetons visuels, ce qui crée un « knob » de compression réglable par la résolution de rendu. Lorsque la résolution diminue, les caractères deviennent plus petits que la résolution effective de l’encodeur, entraînant une perte rapide de précision. Cette limitation apparaît dès que le facteur de compression dépasse un rapport d’environ 2 : 1, rendant les glyphes indiscernables pour le modèle.
Architecture et mécanisme de LensVLM
LensVLM propose un cadre d’inférence couplé à une procédure de post‑entraînement. Le système scanne d’abord l’image compressée, puis, à l’aide d’outils appris, il « déplie » sélectivement les régions jugées pertinentes vers leur forme non compressée. Le modèle de base utilisé est Qwen3.5‑9B‑Base, auquel sont ajoutées des têtes spécialisées capables de décider, pour chaque patch, s’il faut appliquer une expansion textuelle (reconstruction de caractères) ou une expansion d’image haute résolution (reconstruction de mise en page). Cette sélection repose sur un classifieur entraîné à partir de paires image‑texte, ce qui limite le coût supplémentaire à la partie réellement nécessaire du document.
Performances expérimentales et comparaison
Sur sept jeux de questions‑réponses textuelles, LensVLM atteint une précision comparable à la borne supérieure obtenue avec le texte complet tout en appliquant un facteur de compression effectif de 4,3×. En comparaison, les meilleures solutions de compression basées sur la récupération, le texte ou l’image restent en dessous de ce seuil, avec des dégradations allant jusqu’à 10,1× de compression avant que la précision ne chute sous le niveau de LensVLM. Le modèle conserve également un avantage sur des tâches multimodales de compréhension de documents et de code, où l’écart de performance augmente proportionnellement à la compression appliquée.
Analyse des limites et perspectives
L’étude montre que l’entraînement rend la compression visuelle robuste aux variations de rendu, mais que la dépendance du modèle à l’expansion sélective croît avec le taux de compression. Deux recommandations émergent : privilégier l’expansion textuelle pour les documents purement textuels rendus, et recourir à l’expansion d’image haute résolution pour les documents natifs où la mise en page porte une information sémantique. Les limites actuelles concernent le coût de calcul additionnel lié à la détection et à l’expansion, ainsi que la sensibilité aux outils d’expansion mal entraînés. Des recherches futures pourraient explorer des stratégies d’optimisation du pipeline d’expansion et l’intégration de mécanismes de méta‑apprentissage pour adapter automatiquement le choix d’outil en fonction du domaine d’application.