En résumé
LFM2.5-VL-3B atteint 69,4 de moyenne sur 28 benchmarks de vision et tient dans environ 3 Go de mémoire.
Le modèle améliore fortement le grounding et introduit l’appel de fonctions dans la gamme vision-langage de Liquid AI.
L’usage commercial gratuit est réservé aux entreprises dont le chiffre d’affaires annuel reste inférieur à 10 millions de dollars.
Le signal : Avec environ 3 Go de mémoire et 228 tokens par seconde sur Apple M5 Max, Liquid AI destine LFM2.5-VL-3B aux agents d’écran sur appareil.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs
Liquid AI a publié LFM2.5-VL-3B, un modèle vision-langage de 3,1 milliards de paramètres conçu pour fonctionner sur appareil. Il peut lire des écrans mobiles, web et desktop, associer des objets à des coordonnées, analyser des documents et des graphiques, puis appeler des outils à partir d’un texte ou d’une image. Le modèle est non raisonnant: il répond directement pour maintenir une latence réduite.
LFM2.5-VL-3B tient dans environ 3 Go de mémoire et atteint 228 tokens par seconde sur une puce Apple M5 Max, ainsi que 20 tokens par seconde sur un Galaxy S26 Ultra. Le checkpoint est proposé en quatre formats, natif, GGUF, ONNX et MLX. Les runtimes disponibles dès le lancement incluent llama.cpp, MLX, vLLM, SGLang et ONNX.
Le modèle cible notamment les agents d’écran, l’automatisation de tests GUI, la conversion de PDF en texte structuré avec labels de mise en page, l’OCR de factures et reçus, la détection d’objets dans les véhicules, la traduction hors ligne de menus et panneaux routiers, ainsi que la comparaison de plusieurs images. Liquid AI cite des applications dans l’électronique grand public, l’automobile, l’industrie et la robotique, les services financiers, la santé et le e-commerce.
Liquid AI rapporte une moyenne de 69,4 sur 28 benchmarks de vision, à égalité avec InternVL-3.5-4B et à 0,7 point de Qwen3.5-4B, deux modèles de 4,7 milliards de paramètres.
L’architecture combine le backbone linguistique LFM2.5-2.6B et un encodeur visuel SigLIP2 NaFlex de 400 millions de paramètres. Le contexte atteint 32 768 tokens et 16 langues sont prises en charge. L’entraînement s’appuie sur environ 34 000 milliards de tokens, un vocabulaire étendu à 128 000 entrées et quatre fois plus de tokens de pré-entraînement visuel, avec des données de légendage, OCR, grounding et suivi d’instructions.
La licence LFM Open License v1.0 repose sur Apache-2.0, mais l’usage commercial gratuit s’arrête lorsque le chiffre d’affaires annuel d’une entreprise atteint 10 millions de dollars. Les indépendants, startups et PME sous ce seuil peuvent donc déployer le modèle sans coût de licence, tandis que les entreprises au-dessus doivent négocier avec Liquid AI. La recherche, l’éducation et les organisations à but non lucratif ne sont soumises à aucune limite de revenus.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs