Ai2 transforme OLMES en atelier pour développer les LLM
#benchmark #ia-code 3 min · 3 septembre 2026

Ai2 transforme OLMES en atelier pour développer les LLM

Par Arthur Dekeyser

En résumé

1

Ai2 publie olmo-eval pour répéter les évaluations sur plusieurs checkpoints.

2

L’outil sépare les tâches évaluées des politiques d’exécution choisies.

3

Le visualiseur compare les réponses question par question entre deux modèles.

💡

Le signal : Ai2 transforme OLMES en atelier de développement avec comparaison question par question, exécution en conteneur et analyse du bruit statistique.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Ai2 transforme OLMES en atelier de développement

Ai2 publie olmo-eval pour accompagner le développement répété des grands modèles de langage. L’organisation présente cet atelier comme une extension d’OLMES, son standard ouvert lancé en 2024. Le logiciel sert à ajouter ou reconfigurer des évaluations, puis à les exécuter sur chaque nouveau checkpoint. Il permet aussi d’examiner les résultats afin de vérifier l’effet d’une intervention. Les interventions concernent notamment les données, l’architecture, les hyperparamètres et l’échelle d’entraînement.

Ai2 indique que les outils habituels ciblent surtout les modèles terminés ou les problèmes d’agents en environnement isolé. olmo-eval vise plutôt la boucle quotidienne de développement, lorsque les chercheurs modifient régulièrement un modèle et veulent mesurer l’impact de chaque changement. Le projet est publié ouvertement sur GitHub.

OLMES fixe les comparaisons entre modèles en documentant les choix de référence. Avant son lancement, un même modèle pouvait obtenir des scores différents selon le format des invites ou la formulation des tâches. OLMES a standardisé ces paramètres pour rendre les résultats plus comparables et reproductibles. Ai2 l’a utilisé pour évaluer ses modèles ouverts, d’Olmo à Tulu.

olmo-eval reprend cette base, mais l’étend aux étapes précédant le score final. L’outil réduit le travail nécessaire pour créer une nouvelle évaluation. Il accepte aussi des définitions plus flexibles et compose plusieurs composants dans des flux de travail. Ai2 positionne ainsi OLMES comme le socle de mesure, et olmo-eval comme l’atelier opérationnel associé. OLMES est également disponible sur GitHub.

Ai2 sépare tâches et exécution

Harbor couvre un autre périmètre avec son cadre ouvert pour évaluer des agents dans des environnements conteneurisés et isolés. Harbor vise principalement l’exécution et la publication de références d’agents. olmo-eval cible l’ajout de références, leur configuration, leur répétition sur des checkpoints et l’analyse des résultats.

Harbor exécute chaque évaluation dans un conteneur reproductible. olmo-eval choisit le mode selon les besoins de la tâche. Une question simple peut être traitée directement, tandis qu’une tâche exécutant du code généré reçoit un environnement isolé. Le chemin léger constitue le réglage par défaut. Cette approche réserve les conteneurs aux évaluations qui en ont réellement besoin. Les deux outils séparent la référence de la politique d’exécution, mais olmo-eval ajoute des composants interchangeables.

Quatre composants structurent l’atelier et resserrent la boucle expérimentale. L’abstraction tâche, suite et harnais sépare la logique de référence du mode d’exécution. Une tâche définit les données, les requêtes et le calcul du score. Une suite regroupe plusieurs tâches. Un harnais précise le modèle, les outils, l’environnement et les modèles auxiliaires.

La couche de bac à sable et de routage gère les évaluations avec outils, comme l’écriture de code ou la navigation web. Le schéma expérimental normalisé conserve la configuration, les résultats et chaque exécution dans un format commun. Enfin, le visualiseur aligne deux modèles ou checkpoints question par question. Cette comparaison complète le score global, l’erreur standard et l’effet minimal détectable.

olmo-eval compare chaque checkpoint

Les tâches restent réutilisables grâce aux variantes et aux harnais. Une même référence peut être lancée en mode standard, puis avec des outils ou un échafaudage différent, sans modifier ce qu’elle mesure. Les outils peuvent être réutilisés entre plusieurs tâches et les modèles de notation peuvent être remplacés séparément.

Ai2 prévoit aussi les évaluations multi-tours comme usage central. Les références existantes peuvent conserver leur propre procédure grâce à un habillage léger. Les exécutions parallèles en conteneurs s’appuient sur des instances de bac à sable et un routage par capacités. Docker et Modal sont proposés pour ces modes isolés.

Le visualiseur permet ensuite d’examiner les divergences entre deux modèles, au-delà d’un classement unique. Les équipes peuvent repérer les questions auxquelles un checkpoint progresse, celles où il régresse et les cas qui contribuent le plus à l’écart observé. Cette lecture détaillée aide à distinguer une amélioration réelle d’une variation liée au bruit statistique ou à un petit nombre d’exemples.

Le projet fournit donc une architecture pour répéter, comparer et analyser les expérimentations durant l’entraînement. En rapprochant la définition des tâches, leur exécution et l’examen des réponses, olmo-eval cherche à rendre les évaluations plus rapides à adapter, plus faciles à reproduire et plus utiles pour guider le développement des modèles.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi