# Ai2 dévoile olmo-eval pour tester chaque version

> Ai2 publie olmo-eval, un atelier ouvert qui prolonge OLMES pour évaluer les modèles à chaque checkpoint et comparer les interventions.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-09-14 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/ai2-lance-olmo-eval-pour-comparer-chaque-version
Tags : évaluation, modèles de langage, open source, agents, reproductibilité, benchmark

---

## En résumé

- Ai2 publie olmo-eval pour suivre les évaluations pendant le développement des modèles.
- Olmo-eval compare les checkpoints question par question avec une erreur standard et un effet minimal détectable.
- L’outil sépare les tâches d’évaluation des règles d’exécution et prend en charge les agents et les environnements isolés.

**Le signal :** Ai2 transforme OLMES en atelier de développement avec olmo-eval, conçu pour comparer les checkpoints question par question.

**Ai2 publie olmo-eval.** Le 12 juin 2026, l’Allen Institute for AI a annoncé olmo-eval, un atelier ouvert pour le développement des [modèles de langage](/signal-ia/actu/ai2-lance-olmo-eval-latelier-qui-compare-les-modeles). L’outil prolonge OLMES, le standard d’évaluation présenté en 2024. Il vise les équipes qui évaluent un modèle après chaque modification des données, de l’architecture ou des hyperparamètres. Chaque nouveau checkpoint peut ainsi repasser par les mêmes évaluations. Olmo-eval regroupe l’ajout des références, leur configuration, l’exécution et l’analyse des résultats. Ai2 le destine aux comparaisons répétées pendant l’entraînement. La présentation officielle est disponible sur le [blog d’Ai2](https://allenai.org/blog/olmo-eval), avec le code sur [GitHub](https://github.com/allenai/olmo-eval).

**OLMES fixe les comparaisons.** OLMES a été conçu pour rendre les scores de modèles plus comparables entre publications. Avant son introduction, le format des invites et la formulation des tâches pouvaient varier entre deux évaluations d’un même modèle. Le standard documente ces choix et sert de base aux modèles ouverts d’Ai2, notamment Olmo et Tulu. Olmo-eval reprend cette base, mais l’étend au reste de la boucle de développement. L’outil facilite la création de nouvelles évaluations et leur exécution sur plusieurs checkpoints. Il permet aussi de composer des composants dans des flux plus larges. La référence OLMES reste accessible dans son [dépôt GitHub](https://github.com/allenai/olmes).

## Olmo-eval sépare tâches et exécution

**Quatre composants structurent l’atelier.** Olmo-eval associe une abstraction tâche, suite et harness, une couche de bac à sable, un schéma d’expérience normalisé et un visualiseur de résultats. Une tâche décrit le jeu de données, la construction des demandes et la notation. Une suite regroupe plusieurs tâches exécutées ensemble. Le harness définit les conditions d’exécution. Cette séparation permet de relancer une même tâche comme référence standard, ou avec des outils et un échafaudage différent. Le modèle évalué, les outils, l’environnement conteneurisé et les modèles auxiliaires peuvent être remplacés séparément. Les outils peuvent également être réutilisés entre plusieurs harnesses.

**Les environnements s’adaptent.** Olmo-eval n’impose pas un conteneur pour chaque benchmark. Une [évaluation](/signal-ia/actu/ai2-devoile-olmo-eval-pour-traquer-les-vrais-progres) qui demande seulement une réponse peut s’exécuter directement. Une autre, qui fait fonctionner du code produit par le modèle, peut utiliser un environnement isolé. Le chemin léger est activé par défaut. Le système de planification asynchrone des bacs à sable prend en charge l’exécution parallèle et le routage selon les capacités. Les modes Docker et Modal sont proposés pour les environnements isolés. L’outil prend aussi en charge les évaluations à plusieurs tours, l’usage d’outils et les échafaudages sélectionnés par le harness. Cette organisation distingue olmo-eval de Harbor, centré sur les benchmarks d’agents publiés.

## Les checkpoints se comparent question par question

**Les résultats gagnent en précision.** Olmo-eval conserve un score global pour chaque modèle, avec une erreur standard et un effet minimal détectable. Ce dernier correspond à la plus petite différence pouvant être distinguée de l’incertitude statistique. Le visualiseur aligne ensuite deux modèles ou checkpoints question par question. Cette lecture peut révéler une amélioration réelle qu’une moyenne masque. Elle peut aussi montrer qu’une faible variation globale relève du bruit. Le schéma normalisé enregistre chaque exécution, sa configuration et ses résultats dans un format structuré. Les équipes peuvent ainsi regrouper des expériences liées et comparer des checkpoints au fil du temps.

**Le code reste modulaire.** Une évaluation simple peut être définie par une tâche comprenant une source de données, des paramètres d’échantillonnage, des métriques et un système de scoring. Des variantes permettent de modifier la politique d’évaluation sans recopier le benchmark. L’exemple fourni par Ai2 crée une tâche InternalFreshQA avec une source située sur s3, une température de 0 et un score par correspondance exacte. Une suite peut réunir SciQ, ARC Challenge et InternalFreshQA en trois exemples. Le même benchmark peut ensuite fonctionner avec un harness de recherche et d’outils, sans modifier sa définition ni son système de notation.

**Ai2 ouvre l’usage aux développeurs.** Olmo-eval cible les situations où une équipe relance régulièrement les mêmes [benchmarks](/signal-ia/actu/benchmirt-revele-ce-que-mesurent-vraiment-les-tests-ia) sur de nouveaux checkpoints. L’outil rapproche l’évaluation de la boucle de développement, plutôt que d’une mesure unique sur un modèle terminé. Il prend en charge les évaluations agentiques et à plusieurs tours comme cas d’utilisation principaux. Ai2 publie le projet pour permettre à la communauté de le prolonger. La question opérationnelle devient alors précise : comparer un checkpoint au précédent et localiser les progrès ou les régressions. Cette approche combine la standardisation d’OLMES, l’exécution configurable et l’analyse détaillée des réponses.
