# BenchMIRT révèle ce que cachent les scores des tests IA

> BenchMIRT, présenté le 1er septembre 2026, audite les performances de 100 modèles sur 16 benchmarks et plus de 34 000 questions.

Type : Actualité IA · Catégorie : Tendances · Publié le 2026-09-03 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/benchmirt-revele-ce-que-mesurent-vraiment-les-tests-ia
Tags : benchmarks, modèles de langage, évaluation, raisonnement, sécurité, benchmark

---

## En résumé

- BenchMIRT audite les résultats individuels des tâches de benchmarks.
- La méthode s’appuie sur 100 modèles, 16 benchmarks et plus de 34 000 questions.
- Les résultats distinguent deux dimensions étudiées, la sécurité et le raisonnement général.

**Le signal :** BenchMIRT a été entraîné sur les résultats de 100 modèles de langage évalués avec 16 benchmarks et plus de 34 000 questions.

**Nouvelle méthode** BenchMIRT a été présenté le 1er septembre 2026 comme une méthode d’audit des benchmarks de [modèles de langage](/signal-ia/actu/13-ia-revelent-le-mario-quelles-imaginent). Elle analyse les performances des modèles sur les tâches individuelles composant ces évaluations. Cette approche porte donc sur les résultats détaillés des tâches, plutôt que sur les seuls scores globaux. BenchMIRT a été entraîné avec des résultats provenant de 100 modèles de langage. Ces résultats couvrent 16 benchmarks et plus de 34 000 questions. L’outil vise ainsi un ensemble large d’évaluations et de modèles. Sa présentation est disponible sur le [blog d’Allen Institute for AI](https://huggingface.co/blog/allenai/benchmirt), publié le 1er septembre 2026.

**Périmètre étudié** Six des 16 benchmarks mesurent le raisonnement général. Cet ensemble comprend notamment MMLU-Pro, GPQA, MATH et BBH. Les dix autres benchmarks proviennent de la suite de sécurité Olmo 3. Cette suite comprend notamment HarmBench, StrongReject, WildJailbreak, BBQ, WMDP et XSTest. BenchMIRT s’appuie donc sur deux groupes d’évaluations identifiés dans ces résultats. Le premier groupe rassemble six benchmarks de raisonnement général. Le second rassemble dix benchmarks issus de la suite de sécurité Olmo 3. La méthode examine ces résultats pour auditer les performances des modèles sur les tâches individuelles de chaque [benchmark](/signal-ia/actu/ai2-devoile-olmo-eval-pour-traquer-les-vrais-progres).

## BenchMIRT compare deux dimensions

**Deux dimensions dominantes** BenchMIRT a identifié deux dimensions dominantes dans les résultats analysés. La première dimension correspond à la sécurité. La seconde correspond au [raisonnement](/signal-ia/actu/llm-quatre-methodes-pour-mesurer-leurs-performances) général. Cette distinction organise l’analyse des performances observées sur les 16 benchmarks. Les six benchmarks de raisonnement général incluent MMLU-Pro, GPQA, MATH et BBH. Les dix autres évaluations viennent de la suite de sécurité Olmo 3. Parmi elles figurent HarmBench, StrongReject, WildJailbreak, BBQ, WMDP et XSTest. BenchMIRT relie donc les résultats de ces évaluations à deux dimensions étudiées. La méthode ne se limite pas à présenter un score unique pour chaque modèle.

**Scores de BBQ** Selon l’analyse de BenchMIRT, les scores de BBQ sont davantage alignés avec le raisonnement général qu’avec la sécurité. BBQ fait partie des dix benchmarks issus de la suite de sécurité Olmo 3. Cette association rapproche ses scores de la dimension du raisonnement général identifiée par BenchMIRT. Elle distingue BBQ des évaluations que la suite Olmo 3 regroupe sous l’angle de la sécurité. Le résultat concerne la relation observée entre les scores de BBQ et les deux dimensions étudiées. Il s’inscrit dans l’analyse des performances individuelles des tâches. BenchMIRT a été entraîné sur des résultats couvrant 100 modèles, 16 benchmarks et plus de 34 000 questions.

## WMDP se rapproche du raisonnement

**Résultats sur WMDP** Les scores de WMDP sont davantage associés au raisonnement général qu’à la sécurité, selon BenchMIRT. WMDP appartient également aux dix benchmarks de la suite de sécurité Olmo 3. Cette association relie donc WMDP à la dimension du raisonnement général identifiée par la méthode. BenchMIRT distingue ainsi les scores de WMDP de leur rattachement à la seule dimension de sécurité. L’analyse porte sur les performances obtenues aux tâches individuelles des benchmarks. Elle utilise des résultats issus de 100 modèles de langage, répartis sur 16 benchmarks. Le corpus comprend aussi plus de 34 000 questions. Le code de BenchMIRT est disponible sur [GitHub](https://github.com/allenai/BenchMIRT), et sa présentation figure dans le [papier d’Allen Institute for AI](http://allenai.org/papers/benchmirt).
