En résumé
METR a testé Claude Opus 5.5 sur cinq tâches difficiles pendant dix jours ouvrés.
L’évaluation estime une accélération globale de 1,5 fois des capacités grâce à l’IA.
METR attribue à Claude Opus 5.5 des progrès sur les tâches vérifiables et difficiles à vérifier.
Le signal : METR estime que Claude Opus 5.5 pourrait accélérer la R&D en IA de 1,5 fois au total.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Évaluation préliminaire METR a évalué Claude Opus 5.5 dans le cadre d’un accord non rémunéré consacré à l’évaluation de travaux de recherche et développement en IA. L’étude portait sur l’impact possible du modèle sur la recherche en IA. Elle examinait ses capacités sur des tâches difficiles et longues. Cinq tâches ont servi aux tests. L’équipe les a exécutées pendant dix jours ouvrés. Le protocole comprenait Budget NanoGPT Speedrun, Language Model Conceptual Argumentation, Train a Program, Gaming Bot et Sunlight. METR a également reçu les réponses à un questionnaire. L’équipe a ensuite mené un entretien avec un chercheur d’Anthropic. Lire l’évaluation de METR
Une comparaison avec Fable Claude Opus 5.5 a été comparé à Fable 5.1 sur des tâches vérifiables et sur des tâches plus difficiles à vérifier. L’équipe d’évaluation de METR affirme que le nouveau modèle progresse dans ces deux catégories. Elle estime toutefois que Claude Opus 5.5 ne constitue pas un bond considérable en capacité de recherche et développement en IA par rapport à Fable 5.1. METR prévoit aussi un gain de productivité légèrement supérieur à celui de Fable 5.1. Cette comparaison porte donc sur une amélioration mesurée entre deux modèles. Elle ne présente pas Claude Opus 5.5 comme une rupture nette dans le processus de recherche.
Une estimation globale Le rapport préliminaire de METR estime à 1,5 fois l’accélération globale des capacités attribuable à l’IA. Il associe aussi une probabilité de 30 % à une accélération de 2 fois. Ces deux chiffres proviennent de l’estimation préliminaire consacrée à l’impact sur la recherche en IA. Le rapport ne transforme pas cette estimation en résultat observé sur un programme de recherche complet. METR présente Claude Opus 5.5 à travers les capacités mesurées pendant les cinq tâches. Les résultats relient donc l’évaluation expérimentale à une estimation globale, sans établir que le modèle automatise entièrement le travail des chercheurs.
Un développement partiellement assisté L’équipe d’évaluation de METR considère que le développement de Claude Opus 5.5 a été au moins quelque peu accéléré par l’IA. Elle juge toutefois peu probable que ce développement ait été accéléré de manière spectaculaire par l’IA. Cette appréciation concerne le développement du modèle, et non une mesure générale de productivité dans toutes les organisations. METR prévoit que l’automatisation complète de la recherche et développement en IA nécessitera d’importants progrès en anticipation, en prévision et en jugement des chercheurs. L’équipe associe ce jugement aux compétences souvent désignées par les termes « jugement » ou « goût » des chercheurs.
Une progression par étapes METR considère que des améliorations fréquentes et progressives des capacités de recherche en IA restent compatibles avec un rythme global de progrès rapide. Cette affirmation décrit une relation entre des gains incrémentaux et une progression générale. Elle ne fixe pas le nombre d’améliorations nécessaires avant une évolution qualitative du processus de recherche en IA. L’évaluation indique aussi que Claude Opus 5.5 n’apporte pas d’amélioration importante par rapport à Fable 5.1 dans les compétences de jugement. La conclusion combine donc des gains sur plusieurs tâches, une estimation d’accélération et des limites attribuées au jugement des chercheurs. Consulter la fiche système d’Anthropic
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés