# IFM publie K2 Horizon, six modèles de 0,9B à 375B-A23B

> IFM publie six modèles K2 Horizon sous Apache 2.0, avec données, code et journaux d’entraînement, du format 0,9B au 375B-A23B.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-09-08 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/ifm-ouvre-k2-horizon-avec-six-modeles-sous-apache-20
Tags : modèles ouverts, ia générative, infrastructure, déploiement, évaluation, claude, chatgpt, raisonnement

---

## En résumé

- IFM publie six modèles K2 Horizon sous licence Apache 2.0.
- Les modèles partagent une architecture et un environnement de déploiement communs.
- L’audit d’IFM ramène le score Terminal-Bench de 70,2 % à 66,9 %.

**Le signal :** IFM livre six modèles K2 Horizon de 0,9B à 375B-A23B avec code, corpus et journaux sous Apache 2.0.

**IFM publie K2 Horizon** avec six modèles allant de 0,9B à 375B-A23B. L’Institut of Foundation Models, laboratoire lancé par MBZUAI en mai 2025, les a rendus disponibles la semaine dernière. Chaque modèle est proposé sous licence Apache 2.0 sur Hugging Face. IFM fournit aussi le corpus de pré-entraînement, des points de contrôle intermédiaires, le code, les configurations et des journaux détaillés. La collection couvre les versions 375B-A23B, 36B-A4B, 32B, 7B, 3,7B et 0,9B. Les six modèles disposent de versions FP8 et GGUF. Leur prise en charge initiale couvre vLLM, SGLang et Ollama, sur du matériel NVIDIA, AMD et Cerebras. Les API hébergées passent par Compass, Cerebras et Nebius via [platform.ifm.ai](https://platform.ifm.ai/).

**Une pile commune structure** les six modèles. Ils partagent une architecture, un vocabulaire, une méthode d’entraînement, des interfaces et des outils de déploiement. Le modèle 0,9B utilise toutefois un vocabulaire plus petit. IFM indique que cette cohérence permet de prototyper avec 3,7B, puis de conserver la même pile de service en passant à 375B-A23B. Chaque modèle a été pré-entraîné sur environ 20 000 milliards de tokens. Près de 17 % du corpus contient des trajectoires de résolution de problèmes avec [raisonnement](/signal-ia/actu/atett-dirige-40-pourcent-de-ses-usages-ia-vers-des-modeles-ouverts) explicite. Environ 10 000 milliards de tokens sont synthétiques. Plus de 100 millions de tâches synthétisées uniques ont été utilisées après intégration des données de post-entraînement pendant l’entraînement intermédiaire.

## IFM déploie six modèles compatibles

**MoVA élargit le routage** des experts à l’attention multi-tête. Le mécanisme Mixture-of-Value Attention reste compatible avec FlashAttention, l’attention à requêtes groupées et l’attention éparse. Le modèle K2-Horizon-MoVA-36B-A4B totalise 36 milliards de paramètres, dont environ 4 milliards sont actifs par token. Dans des conditions d’entraînement comparables, il obtient un résultat légèrement inférieur au modèle dense 32B. Les tableaux d’IFM lui attribuent toutefois 58,6 sur Terminal-Bench 2.1 et 26,8 sur tau3-Banking. Il arrive en tête de son ensemble de comparaison sur ces deux [évaluations](/signal-ia/actu/laisi-voit-lecart-se-reduire-kimi-k3-atteint-la-frontiere). Les définitions d’outils ont été présentées en JSON, XML et Markdown. IFM indique que Markdown est environ 18,5 % plus économe en tokens que JSON sur ses données.

**Uno accélère le décodage** avec un adaptateur LoRA. La méthode gèle les paramètres autorégressifs d’Horizon et entraîne des paramètres de diffusion dédiés à la génération efficace. Par distillation de diffusion, ces adaptateurs produisent des blocs de tokens en parallèle. IFM annonce une accélération d’environ trois fois, sans dégradation de qualité. Les versions disponibles sont 7B-Uno et 0,9B-Uno. Le modèle 375B-A23B obtient 70,2 sur Terminal-Bench 2.1, 1 441 Elo sur GDPVal-AA, 67,7 sur MCPMark et 87,3 sur GPQA Diamond. Il atteint 48,4 sur SWE-Atlas-QnA, en tête de son tableau, mais reste derrière GPT-5.6 Luna et [Claude](/signal-ia/actu/aisi-voit-lecart-cyber-entre-ia-ouvertes-et-fermees-fondre) Sonnet 5 sur la plupart des évaluations agentiques.

## IFM corrige son score d’évaluation

**Les petits modèles affichent** plusieurs scores élevés à leur échelle. Le modèle 7B obtient 70,6 sur SWE-bench Verified et 59,0 sur BrowseComp. Le modèle 3,7B atteint 68,6 sur SWE-bench Verified. Le modèle 0,9B obtient 48,5 sur AIME 2026 et 79,9 sur HumanEval+. IFM indique qu’il peut fonctionner sous quantification sur une montre. L’institut a aussi évalué le 375B-A23B sur 89 tâches de Terminal-Bench 2.1, avec huit tentatives par tâche. Sur 712 essais, 500 ont réussi, soit une précision annoncée de 70,2 %. La ré-audit des réussites avec la procédure de recherche de récompense d’Artificial Analysis a signalé 24 essais répartis sur 10 tâches.
