# Apple crée des tests MCP réalistes sans accès aux outils

> Apple présente Agent Seer, un pipeline qui synthétise des scénarios d’évaluation depuis une spécification MCP, sans exemples ni accès aux outils.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-09-08 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/apple-devoile-agent-seer-le-testeur-doutils-mcp
Tags : agents, évaluation, outils, mcp, ia, agents-ia, raisonnement, inference

---

## En résumé

- Agent Seer synthétise des scénarios depuis une seule spécification MCP.
- Le pipeline évalue sept spécifications couvrant plusieurs domaines et tailles.
- La précision des valeurs d’arguments constitue le principal défaut observé.

**Le signal :** Agent Seer évalue sept spécifications MCP et couvre entièrement les petites et moyennes suites d’outils.

**Apple publie Agent Seer** en août 2026, avec Harish Karumuri, Mahesh Vemula et David Lopes Pegna comme auteurs. Le pipeline synthétise des scénarios d’évaluation pour les agents IA utilisant des outils externes. Il part d’une seule spécification du Model Context Protocol, ou MCP. Cette spécification contient les noms des fonctions, leurs descriptions en langage naturel et leurs schémas de paramètres typés. Agent Seer exploite ces informations sémantiques pour produire des scénarios réalistes. Le système ne nécessite ni exemples, ni accès direct aux outils, ni adaptation spécifique à un domaine. Apple présente ce travail dans ses recherches consacrées aux données, à l’annotation et aux outils logiciels.

**Les scénarios remplacent la curation manuelle** dans le processus décrit par les chercheurs. Construire ces tests à la main demande une expertise approfondie des domaines concernés. Cette méthode ne s’étend pas facilement à plusieurs écosystèmes d’outils. Elle produit aussi des bancs d’essai statiques, incapables de suivre l’évolution des interfaces de programmation. Agent Seer enrichit d’abord les schémas bruts. Il génère ensuite des scénarios gradués avec des sorties d’outils synthétiques. Le pipeline transforme enfin ces scénarios en dialogues multi-tours fondés sur des données simulées. Ces dialogues évaluent la justesse des appels d’outils et la cohérence conversationnelle. [Lire la publication Apple](https://machinelearning.apple.com/research/agent-seer-synthesizing-scenarios).

## Agent Seer évalue sept spécifications MCP

**L’évaluation porte sur sept spécifications MCP** couvrant plusieurs domaines et différentes tailles de suites d’outils. Les chercheurs mesurent deux dimensions principales : la justesse des appels d’outils et la cohérence des échanges. Le pipeline obtient une qualité élevée dans l’ensemble des domaines étudiés. Il atteint une couverture complète des outils pour les spécifications petites et moyennes. Cette couverture signifie que les outils présents dans ces spécifications sont représentés dans les scénarios générés. L’étude examine également les variations de qualité entre les configurations. Elle relie ces variations à la complexité des schémas de paramètres. Les résultats sont détaillés dans [la version publiée sur arXiv](https://arxiv.org/abs/2608.26133).

**La complexité des paramètres domine les écarts** de qualité observés par l’analyse. Les chercheurs l’identifient comme le corrélat le plus fort des variations entre scénarios. La taille de la suite d’outils joue un rôle plus faible et orthogonal. Cette distinction sépare la difficulté des paramètres du simple nombre d’outils disponibles. L’analyse identifie aussi la précision des valeurs d’arguments comme le principal mode d’échec. Ce défaut concerne les scénarios imparfaits. Les métriques basées uniquement sur la correspondance des noms ne rendent pas visible cette dimension. Agent Seer mesure donc une précision plus détaillée que le seul choix du bon outil.

## Les arguments concentrent les erreurs

**Les résultats prolongent deux travaux associés** publiés par Apple en mai 2026. PORTool propose une optimisation de politique sensible à l’importance, avec récompense arborescente, pour le raisonnement intégrant plusieurs outils. Ce travail traite l’ambiguïté d’attribution liée aux récompenses fondées uniquement sur le résultat final. Reinforced Agent étudie un retour d’information pendant l’inférence pour les agents appelant des outils. Il évalue notamment la sélection des outils, la précision des paramètres et la reconnaissance du périmètre. Agent Seer se concentre sur la génération de scénarios depuis les spécifications. Les trois travaux relèvent de la recherche Apple sur les outils et plateformes.
Pour aller plus loin, consultez notre guide sur [déployer un agent IA en PME sans développeur](/signal-ia/guides/agents-ia-pme-sans-developpeur-2026).
