BenchMIRT révèle ce que cachent les scores des tests IA
#benchmark 3 min · 3 septembre 2026

BenchMIRT révèle ce que cachent les scores des tests IA

Par Arthur Dekeyser

En résumé

1

BenchMIRT audite les résultats individuels des tâches de benchmarks.

2

La méthode s’appuie sur 100 modèles, 16 benchmarks et plus de 34 000 questions.

3

Les résultats distinguent deux dimensions étudiées, la sécurité et le raisonnement général.

💡

Le signal : BenchMIRT a été entraîné sur les résultats de 100 modèles de langage évalués avec 16 benchmarks et plus de 34 000 questions.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Nouvelle méthode BenchMIRT a été présenté le 1er septembre 2026 comme une méthode d’audit des benchmarks de modèles de langage. Elle analyse les performances des modèles sur les tâches individuelles composant ces évaluations. Cette approche porte donc sur les résultats détaillés des tâches, plutôt que sur les seuls scores globaux. BenchMIRT a été entraîné avec des résultats provenant de 100 modèles de langage. Ces résultats couvrent 16 benchmarks et plus de 34 000 questions. L’outil vise ainsi un ensemble large d’évaluations et de modèles. Sa présentation est disponible sur le blog d’Allen Institute for AI, publié le 1er septembre 2026.

Périmètre étudié Six des 16 benchmarks mesurent le raisonnement général. Cet ensemble comprend notamment MMLU-Pro, GPQA, MATH et BBH. Les dix autres benchmarks proviennent de la suite de sécurité Olmo 3. Cette suite comprend notamment HarmBench, StrongReject, WildJailbreak, BBQ, WMDP et XSTest. BenchMIRT s’appuie donc sur deux groupes d’évaluations identifiés dans ces résultats. Le premier groupe rassemble six benchmarks de raisonnement général. Le second rassemble dix benchmarks issus de la suite de sécurité Olmo 3. La méthode examine ces résultats pour auditer les performances des modèles sur les tâches individuelles de chaque benchmark.

BenchMIRT compare deux dimensions

Deux dimensions dominantes BenchMIRT a identifié deux dimensions dominantes dans les résultats analysés. La première dimension correspond à la sécurité. La seconde correspond au raisonnement général. Cette distinction organise l’analyse des performances observées sur les 16 benchmarks. Les six benchmarks de raisonnement général incluent MMLU-Pro, GPQA, MATH et BBH. Les dix autres évaluations viennent de la suite de sécurité Olmo 3. Parmi elles figurent HarmBench, StrongReject, WildJailbreak, BBQ, WMDP et XSTest. BenchMIRT relie donc les résultats de ces évaluations à deux dimensions étudiées. La méthode ne se limite pas à présenter un score unique pour chaque modèle.

Scores de BBQ Selon l’analyse de BenchMIRT, les scores de BBQ sont davantage alignés avec le raisonnement général qu’avec la sécurité. BBQ fait partie des dix benchmarks issus de la suite de sécurité Olmo 3. Cette association rapproche ses scores de la dimension du raisonnement général identifiée par BenchMIRT. Elle distingue BBQ des évaluations que la suite Olmo 3 regroupe sous l’angle de la sécurité. Le résultat concerne la relation observée entre les scores de BBQ et les deux dimensions étudiées. Il s’inscrit dans l’analyse des performances individuelles des tâches. BenchMIRT a été entraîné sur des résultats couvrant 100 modèles, 16 benchmarks et plus de 34 000 questions.

WMDP se rapproche du raisonnement

Résultats sur WMDP Les scores de WMDP sont davantage associés au raisonnement général qu’à la sécurité, selon BenchMIRT. WMDP appartient également aux dix benchmarks de la suite de sécurité Olmo 3. Cette association relie donc WMDP à la dimension du raisonnement général identifiée par la méthode. BenchMIRT distingue ainsi les scores de WMDP de leur rattachement à la seule dimension de sécurité. L’analyse porte sur les performances obtenues aux tâches individuelles des benchmarks. Elle utilise des résultats issus de 100 modèles de langage, répartis sur 16 benchmarks. Le corpus comprend aussi plus de 34 000 questions. Le code de BenchMIRT est disponible sur GitHub, et sa présentation figure dans le papier d’Allen Institute for AI.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi