Par Arthur Dekeyser
En résumé
Ai2 publie olmo-eval pour évaluer les modèles durant leur développement.
L’outil compare les checkpoints question par question avec l’erreur standard et l’effet minimal détectable.
Olmo-eval sépare les tâches, les suites et les environnements d’exécution.
Le signal : Ai2 transforme OLMES en atelier de développement avec comparaison question par question entre checkpoints.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Ai2 publie olmo-eval le 12 juin 2026 pour accompagner le développement continu des grands modèles de langage. L’atelier ouvert étend OLMES, le standard d’évaluation présenté par Ai2 en 2024. Il permet d’ajouter des repères, de les configurer et de les relancer sur chaque nouveau checkpoint. Les équipes peuvent aussi analyser les résultats au niveau de chaque question. Ai2 vise ainsi les évaluations répétées après chaque modification des données, de l’architecture, des hyperparamètres ou de l’échelle d’entraînement. Le projet est disponible via son dépôt GitHub. Ai2 présente olmo-eval comme un outil destiné à la boucle quotidienne de développement, plutôt qu’à une mesure finale unique.
OLMES fixe les comparaisons depuis 2024 en documentant les choix de formatage des invites et de formulation des tâches. Ai2 explique que des modèles identiques obtenaient auparavant des scores différents selon les publications. Le standard est devenu la base d’évaluation des modèles ouverts d’Olmo à Tulu. Olmo-eval reprend cette base et ajoute davantage de flexibilité pour les évaluations en cours de développement. L’outil prend en charge les scénarios avec agents et les échanges multi-tours. Il fournit aussi des analyses destinées à distinguer une amélioration réelle d’une variation assimilable au bruit. Ai2 publie également le dépôt OLMES, qui documente le standard antérieur.
Harbor vise les benchmarks d’agents exécutés dans des environnements conteneurisés et isolés. Olmo-eval couvre plutôt l’ajout de repères, leur exécution sur plusieurs checkpoints et l’analyse détaillée des résultats. Harbor exécute chaque évaluation dans un conteneur reproductible. Olmo-eval choisit l’environnement selon les besoins du benchmark. Une question simple peut être traitée directement, tandis qu’un code généré peut nécessiter un conteneur isolé. Le chemin léger devient le comportement par défaut. L’environnement lourd intervient seulement lorsqu’un repère le requiert. Pour ajouter une évaluation, olmo-eval accepte une définition courte, des outils, ou une enveloppe autour d’un code existant. Les résultats rejoignent ensuite un format commun.
Les composants restent interchangeables dans l’architecture proposée par Ai2. Une tâche définit le benchmark et les éléments mesurés. Une suite regroupe plusieurs tâches exécutées ensemble. Un harnais contrôle la manière dont chaque tâche fonctionne. Le modèle, les outils, l’environnement conteneurisé et les modèles auxiliaires peuvent être remplacés séparément. Un même outil peut donc servir plusieurs harnais. Un modèle de notation peut aussi être associé à une seule évaluation. Les variantes modifient la politique d’évaluation sans dupliquer le benchmark. L’exemple fourni par Ai2 applique trois exemples à Internal FreshQA, puis une variante sans exemple. Le même benchmark peut enfin être relancé avec ou sans environnement de recherche.
Les résultats gagnent en précision grâce à un schéma expérimental normalisé. Celui-ci conserve la configuration, l’exécution et les résultats de chaque expérience. Les équipes peuvent regrouper des expériences liées et comparer les checkpoints dans le temps. Olmo-eval fournit aussi un score global, une erreur standard et un effet minimal détectable. Ce dernier correspond à la plus petite différence distinguable de manière fiable du bruit. Le lecteur de résultats aligne surtout deux modèles ou checkpoints question par question. Cette comparaison peut révéler une progression réelle masquée par une moyenne globale. Ai2 destine donc l’outil aux équipes qui répètent leurs benchmarks pendant le développement et examinent chaque intervention avec des conditions comparables.”
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés