Par Arthur Dekeyser
En résumé
Les modèles LFM2.5-Encoder-230M et 350M sont plus rapides que les modèles plus grands pour des tâches comme le routage d'intention ou la classification.
L'architecture LFM2 permet un traitement rapide de contextes longs, réduisant le temps de traitement à environ 28 secondes pour 8,192 tokens.
Les encoders sont disponibles sur Hugging Face, adaptés pour des tâches nécessitant performance et économie, sans besoin de GPU.
Le signal : Les LFM2.5-Encoders sont environ 3,7 fois plus rapides que ModernBERT-base pour des contextes de 8,192 tokens.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs
LFM2.5-Encoders viennent d’être lancés sur Hugging Face, offrant des solutions d’inférence rapides pour les contextes longs, même sur CPU. Les modèles LFM2.5-Encoder-230M et 350M égalent ou surpassent les modèles plus volumineux en qualité, tout en étant optimisés pour un fonctionnement à grande vitesse. Ils permettent ainsi de gérer des charges de travail de grande ampleur sur du matériel existant, sans exigence pour un traitement puissant en GPU. Lire l’article ici.
Efficacité accrue est au cœur des LFM2.5-Encoders, qui offrent la possibilité de traiter des tâches de classification et de routage à long terme avec une latence qui s’accroît lentement à mesure que la longueur des entrées augmente. Les encoders, adaptés aux travaux quotidiens exécutés sur CPU, se démarquent par une vitesse supérieure, environ 3,7 fois plus rapide que ModernBERT-base pour des séquences atteignant 8,192 tokens. Cela permettrait de classer un document en moins de 30 secondes sur un CPU de portable.
Performances en benchmarks démontrent que l’Encoder-350M se classe au quatrième rang parmi quatorze modèles sur 17 tâches, selon les benchmarks GLUE, SuperGLUE et multilingues. Par rapport à ces marques, l’Encoder-230M surpasse même ModernBERT-base et les modèles EuroBERT. Ces résultats indiquent que LFM2.5-Encoders restent non seulement compétitifs, mais également une option plus rapide et abordable pour l’inférence sur CPU.
Utilisation et optimisation sont cruciales lors de l’exécution de tâches à forte intensité de données. Les encoders peuvent être fine-tunés pour une large gamme de tâches de traitement du langage naturel, permettant ainsi de conserver les performances sur du matériel peu puissant ou déjà existant. Leur architecture a été pensée pour diminuer les coûts tout en augmentant l’accessibilité à des déploiements rapides.
En France, ce développement présente des avantages tangibles pour les PME et dirigeants qui doivent traiter de grands volumes de données à moindre coût. Ces modèles sont une solution potentielle pour les entreprises souhaitant automatiser des analyses de documents sans investissements massifs dans des infrastructures matérielles avancées.
Comparaisons avec d’autres modèles montrent que, pour un traitement sur GPU, LFM2.5-Encoders rivalisent efficacement avec ModernBERT, bien que la marge soit subtile. Pour des contextes dépassant les 2 000 tokens, les encoders surpassent ModernBERT, ce qui atteste de leur supériorité dans le traitement de données étendues sur CPU et GPU.
Perspectives futures indiquent que ces encoders, disponibles en open source, seront des outils polyvalents pour les développeurs envisageant l’adaptation à des tâches spécifiques de leur domaine, tout en explorant de nouvelles possibilités d’automatisation dans le traitement des données linguistiques.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs