# Liquid AI redéfinit l'interaction écran avec LFM2.5-VL-3B

> Liquid AI publie LFM2.5-VL-3B, un modèle vision-langage de 3,1 milliards de paramètres qui lit les écrans et appelle des outils sur appareil.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-08-14 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/liquid-ai-lance-lfm25-vl-3b-pour-lire-les-ecrans
Tags : liquid ai, modèle vision-langage, ocr, agents sur appareil, appel d’outils, llama, inference

---

## En résumé

- LFM2.5-VL-3B atteint 69,4 de moyenne sur 28 benchmarks de vision et tient dans environ 3 Go de mémoire.
- Le modèle améliore fortement le grounding et introduit l’appel de fonctions dans la gamme vision-langage de Liquid AI.
- L’usage commercial gratuit est réservé aux entreprises dont le chiffre d’affaires annuel reste inférieur à 10 millions de dollars.

**Le signal :** Avec environ 3 Go de mémoire et 228 tokens par seconde sur Apple M5 Max, Liquid AI destine LFM2.5-VL-3B aux agents d’écran sur appareil.

Liquid AI a publié LFM2.5-VL-3B, un modèle vision-langage de 3,1 milliards de paramètres conçu pour fonctionner sur appareil. Il peut lire des écrans mobiles, web et desktop, associer des objets à des coordonnées, analyser des documents et des graphiques, puis appeler des outils à partir d’un texte ou d’une image. Le modèle est non raisonnant: il répond directement pour maintenir une latence réduite.

## Liquid AI vise les usages sur appareil

LFM2.5-VL-3B tient dans environ 3 Go de mémoire et atteint 228 tokens par seconde sur une puce Apple M5 Max, ainsi que 20 tokens par seconde sur un Galaxy S26 Ultra. Le checkpoint est proposé en quatre formats, natif, GGUF, ONNX et MLX. Les runtimes disponibles dès le lancement incluent llama.cpp, MLX, vLLM, SGLang et ONNX.

Le modèle cible notamment les agents d’écran, l’automatisation de tests GUI, la conversion de PDF en texte structuré avec labels de mise en page, l’OCR de factures et reçus, la détection d’objets dans les véhicules, la traduction hors ligne de menus et panneaux routiers, ainsi que la comparaison de plusieurs images. Liquid AI cite des applications dans l’électronique grand public, l’automobile, l’industrie et la robotique, les services financiers, la santé et le e-commerce.

## Benchmarks et nouvelles fonctions

Liquid AI rapporte une moyenne de 69,4 sur 28 benchmarks de vision, à égalité avec InternVL-3.5-4B et à 0,7 point de Qwen3.5-4B, deux modèles de 4,7 milliards de paramètres.

## Une licence commerciale sous condition

L’architecture combine le backbone linguistique LFM2.5-2.6B et un encodeur visuel SigLIP2 NaFlex de 400 millions de paramètres. Le contexte atteint 32 768 tokens et 16 langues sont prises en charge. L’entraînement s’appuie sur environ 34 000 milliards de tokens, un vocabulaire étendu à 128 000 entrées et quatre fois plus de tokens de pré-entraînement visuel, avec des données de légendage, OCR, grounding et suivi d’instructions.

La licence LFM Open License v1.0 repose sur Apache-2.0, mais l’usage commercial gratuit s’arrête lorsque le chiffre d’affaires annuel d’une entreprise atteint 10 millions de dollars. Les indépendants, startups et PME sous ce seuil peuvent donc déployer le modèle sans coût de licence, tandis que les entreprises au-dessus doivent négocier avec Liquid AI. La recherche, l’éducation et les organisations à but non lucratif ne sont soumises à aucune limite de revenus.
