SIGNAL IA / ACTU / BENCHMARKS & CLASSEMENTS

#BENCHMARKS & CLASSEMENTS

Comparatifs, classements et évaluations de modèles IA : leaderboards, tests de performance.

78 articles

Google fait prévoir plusieurs séries à TimesFM-3

Google présente TimesFM-3, un modèle de 330 millions de paramètres qui prévoit plusieurs séries temporelles avec covariables, en un seul passage.

8 septembre 2026

🛡️ CYBERSÉCURITÉ

GPT-6 Astra réussit les 48 défis du test anti-robot

GPT-6 Astra a terminé les 48 niveaux de I’m Not a Robot, relançant le débat sur l’efficacité des captchas face aux IA capables d’agir à l’écran.

8 septembre 2026

OpenAI

SpaceXAI lance Grok 4.6, noté 61 par Artificial Analysis

SpaceXAI a lancé Grok 4.6 le 13 août 2026, avec un score de 61 et un tarif de 2 à 6 dollars par million de jetons.

8 septembre 2026

xAIOpenAI

Perplexity accélère pplx-embed en réutilisant ses noyaux

Perplexity décrit Ivy, Tulip et ROSE, trois services Rust et Python qui servent pplx-embed avec graphes CUDA et exécution asynchrone.

7 septembre 2026

Perplexity
🛡️ CYBERSÉCURITÉ

Capsule Security bloque les dérives des agents IA

Capsule Security a lancé le 2 septembre un coupe-circuit IA capable d’évaluer et de bloquer une action d’agent autonome en 71 millisecondes.

4 septembre 2026

Ai2 transforme OLMES en atelier pour développer les LLM

Ai2 publie olmo-eval, un atelier ouvert qui compare les checkpoints, orchestre les évaluations multi-tours et analyse les écarts entre modèles.

3 septembre 2026

BenchMIRT révèle ce que cachent les scores des tests IA

BenchMIRT, présenté le 1er septembre 2026, audite les performances de 100 modèles sur 16 benchmarks et plus de 34 000 questions.

3 septembre 2026

⚖️ JURIDIQUE

LexisNexis rachète Doctrine après leur bataille judiciaire

LexisNexis rachète Doctrine, Mistral prépare une levée de 3 milliards d’euros et Nvidia acquiert Hugging Face pour 12,9 milliards.

3 septembre 2026

Mistral
📣 MARKETING

Shama Hyder veut faire du GEO un rendez-vous hebdomadaire

Shama Hyder recommande un suivi hebdomadaire du GEO, alors que 68 % des recherches Google américaines se terminent sans clic selon SparkToro.

3 septembre 2026

AnthropicOpenAI

Instinct décroche 250 millions et pèse 2,5 milliards

Instinct a levé 250 millions de dollars, devant Owner et Generalist AI, dans une semaine américaine dominée par les outils et assistants IA.

2 septembre 2026

Orchard-SWE de Microsoft décroche 69,7 % sur SWE-bench

Microsoft Research présente Orchard, un framework en code ouvert qui entraîne et évalue des agents IA dans des environnements réutilisables.

2 septembre 2026

Microsoft

Hugging Face triple l’espace d’Ai2 sur son Hub

Ai2 et Hugging Face triplent le stockage dédié à près de deux pétaoctets et suppriment les limites de débit pour les téléchargements.

1 septembre 2026

Lilian Weng refond son guide Transformer, deux fois plus long

Lilian Weng enrichit son guide sur les Transformers avec une version deux fois plus longue, couvrant attention, mémoire et encodage positionnel.

1 septembre 2026

💰 FINANCE

Agentic Search de Mistral porte FinanceBench à 86 %

Mistral a publié Agentic Search le 20 août 2026, une couche de recherche qui atteint 86 % de précision sur FinanceBench avec GLM-5.2.

1 septembre 2026

MistralAnthropic

13 IA recréent Mario sans voir la moindre image

Pixel32Bench a comparé 13 modèles chargés de recréer Mario en 32×32 pixels, sans image de référence, avec 41 résultats techniquement valides.

31 août 2026

DeepSeek

Anthropic fait progresser l’alignement de ses modèles en autonomie

Anthropic présente un système automatisé qui améliore un modèle sur 10 benchmarks d’alignement, sans dégrader ses performances générales.

31 août 2026

Anthropic
📣 MARKETING

Benu Aggarwal dévoile les trois leviers des marques dans l’IA

Benu Aggarwal propose un cadre en trois couches pour rendre une marque accessible, compréhensible, crédible et actionnable par les moteurs d’IA.

27 août 2026

DeepSeek renchérit ses modèles jusqu’à 12 fois

Depuis le 16 août, DeepSeek facture certains postes jusqu’à douze fois plus cher, selon les données d’Artificial Analysis citées par Leptidigital.

27 août 2026

DeepSeek
🛡️ CYBERSÉCURITÉ

Hack The Box : l’humain complète plus de défis que l’IA

Hack The Box observe que les meilleures équipes humaines ont terminé les 36 défis, tandis que la meilleure équipe augmentée par IA s’est arrêtée à 32.

27 août 2026

Maddyness distingue les 30 bâtisseurs de l’IA française

Maddyness publie le MAD30 AI Backbone, un palmarès de 30 personnalités qui construisent les infrastructures et usages de l’IA en France.

27 août 2026

⚖️ JURIDIQUE

Thomson Reuters défie les grands modèles avec Thomson

Thomson Reuters affirme que son modèle propriétaire Thomson rivalise avec les meilleurs modèles d’IA, après un développement lancé avec Safe Sign Technologies.

27 août 2026

Z.ai lance GLM-5.3-Flash à 57 points pour 0,09 dollar

Z.ai lance GLM-5.3-Flash, un modèle de 320 milliards de paramètres, facturé 0,09 dollar par tâche et évalué à 57 points.

27 août 2026

Microsoft présente Flint pour fiabiliser les graphiques IA

Microsoft présente Flint, un langage intermédiaire ouvert qui transforme des spécifications simples en graphiques soignés pour plusieurs bibliothèques.

26 août 2026

OpenAI
🏭 INDUSTRIE

Microsoft ouvre Orchard, à 69,7 % sur SWE-bench

Microsoft Research publie Orchard, un cadre ouvert qui entraîne des agents IA dans Codex, OpenClaw et ZeroClaw, avec des modèles compacts.

26 août 2026

Anthropic

Avec Bellman-Ford, les réseaux généralisent cinq fois plus loin

Bellman-Ford sert de modèle pour aligner des réseaux neuronaux graphiques sur des algorithmes classiques et tester leur généralisation hors distribution.

25 août 2026

Google prédit les données tabulaires sans entraînement

Google présente TabFM, un modèle fondation pour classifier et régresser sur des tableaux, avec prédictions zero-shot en un seul passage.

25 août 2026

NVIDIA annonce 30 fois plus de débit par mégawatt

NVIDIA annonce jusqu’à 30 fois plus de débit par mégawatt pour Vera Rubin NVL72 que GB300 NVL72 sur les charges d’IA agentique.

25 août 2026

DeepSeek

Nvidia lance le rack Groq 3 LPX chez Nebius cette année

Nvidia annonce la production complète du rack Groq 3 LPX, issu d’une acquisition de 20 milliards de dollars, avec un déploiement prévu cette année.

25 août 2026

🏭 INDUSTRIE

Anthropic multiplie par huit le code fusionné en 2026

Anthropic observe huit fois plus de code fusionné en 2026 qu’en 2021-2024, tandis que SocioHack et des drones testent les limites de l’IA.

24 août 2026

Anthropic

Les clients d’Anthropic délaissent Opus 5 pour réduire leurs coûts

Anthropic atteint 65 milliards de dollars de revenus annualisés en juillet 2026, tandis qu’Opus 5 ne représente que 3,5 % de ses dépenses modèles.

24 août 2026

Anthropic

Grok 4.6 de SpaceXAI atteint 61 à prix réduit

SpaceXAI a lancé Grok 4.6 le 13 août 2026, avec un score de 61 et un tarif annoncé de 2 dollars par million de tokens.

24 août 2026

xAI
⚖️ JURIDIQUE

Tenet de Harvey dépasse presque deux fois Kimi K3 en droit

Harvey présente Tenet, un modèle Kimi K3 post-entraîné avec Fireworks, qui double presque les tâches réussies sur son évaluation juridique.

24 août 2026

Musk et Altman entament leur procès autour d’OpenAI

Le procès Musk contre Altman a commencé le 5 mai 2026, tandis qu’OpenAI a clos le risque juridique de Microsoft lié à son accord Amazon.

24 août 2026

OpenAIMicrosoft

Qwen 3.8 27B fait tourner l’IA sur un portable

Qwen 3.8 27B d’Alibaba tient dans 17 Go et excelle en vision et en code, mais son raisonnement xhigh ralentit fortement les usages locaux.

24 août 2026

OpenAIMeta

Ai2 outille l’évaluation continue des modèles de langage

Ai2 publie olmo-eval, un atelier ouvert pour évaluer les modèles à chaque étape, comparer les points de contrôle et distinguer progrès réel et bruit.

18 août 2026

Ramp révèle un écart de 600 fois dans les dépenses IA

Les entreprises américaines les plus dépensières consacrent 7 400 dollars par salarié à l’IA, contre 11,95 dollars pour l’entreprise médiane.

18 août 2026

AnthropicOpenAI
💰 FINANCE

PYMNTS relie l’essor de l’IA aux fonctions mesurables

PYMNTS indique que l’IA d’entreprise progresse surtout dans les fonctions aux données structurées et aux résultats mesurables, notamment la finance.

18 août 2026

Apple booste l'efficacité avec ARBITRAGE IA

Apple présente ARBITRAGE, un cadre innovant pour améliorer l'efficience des modèles de langage, réduisant la latence d'inférence de moitié.

15 août 2026

💰 FINANCE

Workiva révèle des erreurs d’IA dans le reporting financier

Workiva révèle que 26 % des dirigeants ont vu des erreurs d’IA atteindre des publics externes ou des conseils d’administration, malgré une confiance élevée.

15 août 2026

Claude Opus 5 devance GPT-5.6 Sol selon Artificial Analysis

Au 2 août 2026, Artificial Analysis place Claude Opus 5 devant GPT-5.6 Sol dans son classement des modèles d'IA fondé sur neuf évaluations.

14 août 2026

AnthropicOpenAI

DeepAmbigQA pousse les LLM à résoudre l'ambiguïté

DeepAmbigQA évalue la complétude des réponses de LLM sur 3 600 questions combinant ambiguïté de nom et raisonnement en plusieurs étapes.

14 août 2026

OpenAI

Kimi K3 brille, mais Claude Fable 5 garde l'avantage mondial

Kimi K3 est troisième au classement mondial, mais Claude Fable 5 reste devant malgré une interruption de 19 jours imposée à Anthropic.

14 août 2026

Anthropic

Sebastian Raschka décrypte l'évaluation des LLM

Sebastian Raschka présente quatre méthodes d'évaluation des LLM, dont MMLU, les vérificateurs, les classements et les juges fondés sur des modèles.

14 août 2026

🏥 SANTÉ

Mpathic révèle les lacunes de ChatGPT et Claude en crise

Mpathic publie mPACT, un benchmark clinique qui montre que Claude, GPT-5.2 et Gemini évitent mieux les risques, sans atteindre le niveau attendu en crise.

14 août 2026

AnthropicOpenAI
🏭 INDUSTRIE

ONESTRUCTION lance Ishigaki-IDS pour BIM avec AWS GenAIIC

ONESTRUCTION lance Ishigaki-IDS, un modèle innovant qui améliore les workflows BIM et atteint près de 100 % de conformité structurelle XML.

13 août 2026

🏭 INDUSTRIE

Google TabFM simplifie l'analyse de données sans effort

Google présente TabFM, un modèle qui transforme l'analyse des données tabulaires, rendant obsolètes l'entraînement manuel et l'optimisation hyperparamétrique.

10 août 2026

Olmo-eval par Allen Institute redéfinit l'évaluation LLM

L'outil olmo-eval d'Allen Institute simplifie l'évaluation continue des modèles de langage en développement, facilitant ainsi l'optimisation des performances des modèles IA.

10 août 2026

⚖️ JURIDIQUE

Thomson Reuters dépasse GPT-5.5 avec son IA novatrice

Thomson Reuters a développé un grand modèle linguistique nommé Thomson, performant à la hauteur de Claude Opus 4.8 et surpassant GPT-5.5.

7 août 2026

AnthropicOpenAI
NEWSLETTER BUSINESS & IA

Gardez un coup d'avance en business et IA

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés