Présentation

Les LFM2.5-Encoders sont conçus pour offrir une inférence rapide et efficace sur les processeurs CPU, même avec des contextes longs. Ces encoders sont pré-entraînés avec un objectif de modèle de langage masqué et peuvent être affinés pour diverses tâches telles que la classification, la détection d'intentions et la recherche.

Architecture et fonctionnement

Les LFM2.5-Encoders sont basés sur l'architecture LFM2 et sont disponibles en deux tailles : 230M et 350M. Ils utilisent une attention bidirectionnelle, des convolutions courtes non causales et un modèle de langage masqué pour leur pré-entraînement. Les expériences montrent que ces encoders peuvent rivaliser avec des modèles plus grands sur des tâches de classification et de recherche, tout en offrant une meilleure efficacité en termes de temps de traitement.

Performances et avantages

Les tests ont démontré que les LFM2.5-Encoders sont environ 3,7 fois plus rapides que le ModernBERT-base pour les contextes longs sur CPU. Cette efficacité les rend particulièrement adaptés pour les applications qui nécessitent un traitement rapide de grandes quantités de données, telles que les routeurs d'intention, les filtres de sécurité et les détecteurs de données personnelles. Les développeurs peuvent utiliser ces encoders pour construire des applications qui fonctionnent de manière efficace sur les processeurs CPU, sans nécessiter de matériel spécialisé.

Utilisation et intégration

Pour utiliser les LFM2.5-Encoders, les développeurs peuvent simplement les charger à l'aide de la bibliothèque Transformers et les affiner pour leurs tâches spécifiques. Les exemples de code fournis montrent comment charger un modèle, effectuer une prédiction de token masqué et affiner le modèle pour une tâche particulière. Les LFM2.5-Encoders sont disponibles sur Hugging Face, accompagnés de tutoriels et de démos pour faciliter leur intégration dans les applications existantes.