# Ai2 outille l’évaluation continue des modèles de langage

> Ai2 publie olmo-eval, un atelier ouvert pour évaluer les modèles à chaque étape, comparer les points de contrôle et distinguer progrès réel et bruit.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-08-18 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/ai2-devoile-olmo-eval-pour-traquer-les-vrais-progres
Tags : évaluation, modèles de langage, code ouvert, reproductibilité, open-source, benchmark

---

## En résumé

- Ai2 publie olmo-eval pour suivre les évaluations pendant le développement des modèles.
- L’outil sépare les tâches évaluées de la politique d’exécution et des outils utilisés.
- Le comparateur question par question aide à distinguer une amélioration réelle du bruit.

**Le signal :** Ai2 conçoit olmo-eval pour comparer deux points de contrôle question par question, avec erreur standard et effet minimal détectable.

**Ai2 publie olmo-eval** le 12 juin 2026 pour accompagner le développement continu des [modèles de langage](/signal-ia/actu/cisco-antares-lia-localise-les-failles-a-moindre-cout). L’outil vise les équipes qui réévaluent un modèle après chaque modification de données, d’architecture, d’hyperparamètres ou d’échelle. Ai2 le présente comme un atelier d’évaluation construit pour répéter cette boucle sur plusieurs points de contrôle. Il permet d’ajouter ou de reconfigurer des évaluations, de les relancer et d’analyser leurs résultats. Le projet prolonge [OLMES](https://github.com/allenai/olmes), la norme ouverte introduite en 2024. Ai2 utilisait OLMES pour comparer ses modèles ouverts, d’Olmo à Tulu. La nouvelle version étend cette approche au travail quotidien de développement, plutôt qu’au seul score final.

**OLMES fixait les comparaisons** entre modèles en documentant le format des invites et la formulation des tâches. Ai2 explique que des modèles identiques recevaient parfois des scores différents selon les choix retenus dans chaque publication. OLMES cherchait donc à rendre les résultats plus comparables et reproductibles. Olmo-eval reprend cette base, mais ajoute davantage de flexibilité dans la définition et l’exécution des évaluations. Il prend aussi en charge les scénarios avec agents et échanges multiples. Son analyse examine les réponses question par question, au lieu de limiter la lecture à une moyenne générale. Ai2 publie le code sur [GitHub](https://github.com/allenai/olmo-eval), avec une orientation vers les expérimentations répétées.

## Ai2 sépare tâches et exécution

**Quatre composants structurent** olmo-eval. La séparation tâche, suite et harnais distingue la logique d’un test de la manière dont le modèle s’exécute. Une tâche définit le jeu de données, la construction des demandes et le calcul du score. Une suite regroupe plusieurs tâches, tandis qu’un harnais détermine l’exécution. Le même test peut donc fonctionner comme référence standard, avec des outils ou avec un dispositif d’assistance. Une couche de bac à sable et de routage par capacités prend en charge les outils. Elle peut exécuter du code ou une navigation lorsque l’[évaluation](/signal-ia/actu/hugging-face-integre-les-resultats-every-eval-ever) le demande. Un schéma expérimental normalisé enregistre ensuite configuration, résultats et liens entre essais.

**Harbor couvre un périmètre** différent selon Ai2. Ce cadre ouvert évalue principalement des agents dans des environnements conteneurisés et publie leurs résultats. Olmo-eval cible plutôt le développement quotidien d’un modèle, avec des relances fréquentes sur plusieurs points de contrôle. Harbor exécute chaque évaluation dans des conteneurs scellés et reproductibles. Olmo-eval choisit le mode selon les besoins du test. Une question simple peut être traitée directement, tandis qu’un test exécutant du code peut utiliser un conteneur isolé. L’approche légère est la configuration par défaut. Les deux outils séparent les références de test de la politique d’exécution, mais olmo-eval rend ses composants interchangeables.

## Les comparaisons mesurent le bruit

**Les résultats incluent** un score global, une erreur standard et un effet minimal détectable. Ce dernier représente la plus petite différence que l’analyse peut distinguer de manière fiable du bruit. Olmo-eval aligne aussi deux modèles ou deux points de contrôle question par question. Cette vue peut révéler une amélioration que la moyenne masque, ou montrer qu’une variation globale ne constitue pas un progrès établi. Le projet permet de réutiliser un outil dans plusieurs harnais et d’ajuster une invite sans réécrire toute l’évaluation. Il prend également en charge l’exécution parallèle de conteneurs, avec Docker ou Modal, ainsi que des modèles auxiliaires servant de juges.

**Les prochaines étapes** concernent l’usage du [code ouvert](/signal-ia/actu/a-pekin-song-de-offre-deepseek-a-volonte-malgre-les-pertes) par la communauté. Ai2 recommande olmo-eval lorsque l’évaluation accompagne un développement continu, avec les mêmes tests répétés sur plusieurs points de contrôle. Le projet répond notamment à la question suivante : comment un nouveau point de contrôle diffère-t-il du précédent, et sur quelles questions ? Les tâches peuvent être définies avec une source de données, des paramètres d’échantillonnage, des métriques et un mécanisme de correction. Des variantes permettent de modifier la politique d’évaluation sans dupliquer le test. Ai2 indique aussi que le même test peut être relancé avec un harnais de recherche ou d’outils, sans modifier sa définition.
