# Liquid AI propulse LFM2.5-350M à 29,7 % sur IFStruct

> Liquid AI fait passer LFM2.5-350M de 22,6 % à 29,7 % sur IFStruct après 100 étapes GRPO et environ 500 exemples d’entraînement.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-09-09 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/liquid-ai-fait-grimper-lfm25-350m-a-297-pourcent-sur-ifstruct
Tags : fine-tuning, modèles compacts, sorties structurées, grpo, code ouvert, llama, raisonnement, inference

---

## En résumé

- Liquid AI entraîne LFM2.5-350M avec GRPO pendant 100 étapes.
- Le modèle passe de 22,6 % à 29,7 % de réussite sur IFStruct.
- La procédure utilise environ 500 exemples et six millions de paramètres LoRA.

**Le signal :** Liquid AI fait progresser LFM2.5-350M de 22,6 % à 29,7 % sur 2 000 tests IFStruct.

**Liquid AI publie** une procédure de réglage fin pour améliorer les sorties structurées d’un petit modèle. L’équipe applique Group Relative Policy Optimization, ou GRPO, à LFM2.5-350M avec la bibliothèque TRL. Le parcours complet utilise environ 500 exemples et 100 étapes d’entraînement. Sur le banc IFStruct, le modèle passe de 22,6 % à 29,7 % de sorties valides. L’[évaluation](/signal-ia/actu/apple-devoile-agent-seer-le-testeur-doutils-mcp) porte sur 2 000 échantillons. La procédure vise la conformité à un schéma, la forme demandée et le nombre de champs. Le guide est public et peut fonctionner sur un GPU Colab ou Kaggle gratuit. [Le guide Hugging Face](https://huggingface.co/blog/grpo-with-trl-ifstruct) fournit le parcours complet et les commandes utilisées.

**Les sorties structurées** conditionnent l’intégration d’un modèle dans un système aval. IFStruct mesure la validité des réponses et leur respect du schéma, séparément des scores de [raisonnement](/signal-ia/actu/alpamayo-2-pulverise-gpt-4o-de-232-pts-sur-lingoqa) ou d’extraction. L’évaluation compare ici deux modèles servis avec la même pile locale, basée sur llama.cpp et un fichier GGUF BF16. Le modèle initial obtient 452 réussites sur 2 000 tests, avec une latence moyenne de 1 453 millisecondes. Il réussit 18,0 % des tâches JSON et 27,2 % des tâches YAML. Les listes seules atteignent 16,6 %, contre 28,5 % pour les réponses avec clé enveloppe. Le dépôt [Liquid4All/ifstruct](https://github.com/Liquid4All/ifstruct) contient l’évaluateur et les données publiques.

## Liquid AI entraîne LFM2.5-350M

**Le jeu d’entraînement** repose sur nvidia/Nemotron-RL-instruction_following-structured_outputs. Chaque exemple associe une consigne, un schéma JSON cible et un nombre attendu de champs. L’équipe ajoute une instruction de bloc de code à 40 % des invites. Elle transforme séparément 20 % des exemples en tâches avec tableau racine et nombre d’éléments requis. Ces ajouts ciblent deux différences entre les données d’entraînement et IFStruct. Le modèle reçoit un adaptateur LoRA sur plusieurs modules propres à LFM2.5. Cette configuration entraîne environ six millions de paramètres, soit 1,66 % du modèle. Les trois récompenses évaluent le format JSON, le nombre de champs et la validation du schéma.

**Les récompenses combinées** utilisent des poids de 1,0 pour le format JSON, 0,5 pour le nombre de champs et 2,0 pour la validation du schéma. L’entraînement emploie huit générations par groupe d’invites, un taux d’apprentissage de 5e-5 et 100 étapes maximales. La taille de lot par appareil est de quatre, avec huit étapes d’accumulation des gradients. La longueur maximale des complétions atteint 1 024 jetons. Après l’entraînement, l’adaptateur LoRA est fusionné avec les poids de base. Le modèle fusionné est ensuite converti en GGUF BF16 avant son service avec llama.cpp. Le [carnet d’exécution public](https://github.com/Liquid4All/cookbook/blob/main/finetuning/notebooks/grpo_with_trl_ifstruct.ipynb) détaille cette séquence.

## IFStruct mesure les gains obtenus

**Le modèle ajusté** valide 594 réponses sur 2 000, soit 29,7 %, avec une [latence](/signal-ia/actu/apple-reduit-de-plus-de-5-fois-la-latence-video-avec-ivt) moyenne de 1 518 millisecondes. Son score JSON atteint 31,9 %, contre 18,0 % pour le modèle initial. Le YAML progresse de 27,2 % à 27,5 %. Les listes seules passent de 16,6 % à 29,7 %, tandis que les réponses avec clé enveloppe évoluent de 28,5 % à 29,7 %. Les résultats varient selon les catégories. Les réservations de billets atteignent 57,9 %, les tickets de support 49,3 % et les factures 41,9 %. Les recettes restent à 10,0 %, malgré l’ajustement réalisé sur la même évaluation.
