SIGNAL IA / ACTU / BENCHMARKS & CLASSEMENTS

#BENCHMARKS & CLASSEMENTS

Comparatifs, classements et évaluations de modèles IA : leaderboards, tests de performance.

18 articles

📣 MARKETING

SDR-Bench : la personnalisation des IA en question

Un benchmark révèle que les grands modèles de langage plafonnent en personnalisation dans le secteur des ventes, sans différencier succès et échec.

24 juillet 2026

#benchmark

Sécurité IA : OpenAI face à une évaluation chaotique

Les coûts et délais de tests compliquent l'évaluation des modèles IA, posant des risques de sécurité importants.

24 juillet 2026

#benchmark

Soofi S : le modèle allemand qui surpasse les benchmarks

Soofi S, un modèle IA de 30 milliards de paramètres, surpasse les benchmarks en anglais et en allemand, établi par un consortium allemand.

24 juillet 2026

#benchmark

EdgeBench : l'outil qui bouscule le test des agents IA

EdgeBench se présente comme un benchmark pratique pour évaluer les agents IA avancés à travers diverses tâches.

23 juillet 2026

#benchmark

Apple bouscule la synthèse vidéo avec LVSum

Apple introduit LVSum, un nouveau standard pour l'évaluation de la synthèse de longues vidéos avec alignement temporel précis.

22 juillet 2026

#benchmark

Cisco Antares : l'IA localise les failles à moindre coût

Cisco Foundation AI lance Antares, utilisant des modèles IA avancés pour identifier efficacement les vulnérabilités dans le code à coût réduit.

22 juillet 2026

#benchmark

ScarfBench par IBM : agents IA et échec en Java

ScarfBench, lancé par IBM, évalue les agents IA sur la migration de frameworks Java avec seulement 10% de succès comportemental.

21 juillet 2026

#benchmark
🏥 SANTÉ

RadLE 2.0 : IA en radiologie trop confiantes, danger en vue

Selon le benchmark RadLE 2.0, les chatbots IA en radiologie peuvent être trop confiants même quand leurs diagnostics sont erronés.

20 juillet 2026

#benchmark

Visibilité IA : un indicateur trompeur pour le marketing

Les outils mesurant la visibilité IA utilisent souvent des indicateurs erronés comme le suivi de prompts, selon des experts.

19 juillet 2026

#benchmark

VoiceEQ de HumeAI : l'IA vocale jugée par 1M d'évaluations

Real World VoiceEQ de HumeAI mesure la qualité humaine de l'IA vocale sur plus de 60 critères et 1 million d'évaluations.

15 juillet 2026

#benchmark

MORPHEUS de Skyfall AI : apprentissage sans fin bouscule l'entreprise

MORPHEUS de Skyfall AI propose une simulation d'entreprise continue nécessitant un apprentissage par renforcement avec des changements de régime structurés.

14 juillet 2026

#benchmark

SpaceXAI : Grok 4.5 bouscule le codage à 80 TPS

Grok 4.5 de SpaceXAI, formé par Cursor, excelle en codage et tâches agentiques à 80 TPS.

9 juillet 2026

#benchmark

Anthropic s'impose face à l'essor des modèles open source

Anthropic conserve sa position dominante malgré une montée des modèles open source et des dépenses stables sur les modèles coûteux.

8 juillet 2026

#benchmark

Hugging Face : l'intégration révolutionne SageMaker

Hugging Face intègre SageMaker Studio, simplifiant le chemin du modèle AI à l'implémentation en un clic.

8 juillet 2026

#benchmark

Sakana AI : Sakana Translate bouscule la traduction

Sakana AI introduit Sakana Translate pour traduire, corriger et interroger entre japonais, anglais et chinois.

6 juillet 2026

#benchmark

Hugging Face : la comparaison IA bousculée par EEE

Hugging Face et EEE unifient l'affichage des résultats d'évaluation, facilitant la comparaison des modèles IA.

1 juillet 2026

#benchmark

OpenAI : GeneBench-Pro redéfinit la recherche génomique

OpenAI dévoile GeneBench-Pro, un nouveau standard pour tester l'efficacité de l'IA dans la recherche scientifique en utilisant des ensembles de données complexes.

1 juillet 2026

#benchmark

ScarfBench : l'obstacle Java qui déroute les agents IA

ScarfBench est un benchmark pour tester la capacité des agents AI à migrer les applications Java d'entreprise entre différents frameworks.

1 juillet 2026

#benchmark