Google présente TabFM, un modèle qui transforme l'analyse des données tabulaires, rendant obsolètes l'entraînement manuel et l'optimisation hyperparamétrique.
10 août 2026
#benchmark
L'outil olmo-eval d'Allen Institute simplifie l'évaluation continue des modèles de langage en développement, facilitant ainsi l'optimisation des performances des modèles IA.
10 août 2026
#benchmark
Thomson Reuters a développé un grand modèle linguistique nommé Thomson, performant à la hauteur de Claude Opus 4.8 et surpassant GPT-5.5.
7 août 2026
#benchmark
Le dialogue intentionnel avec les chatbots LLM devient crucial mais pose des problématiques non résolues par les mesures actuelles.
6 août 2026
#benchmark
OWASP dévoile son Top 10 pour 2026, influencé par les données réelles pour la première fois. L'accent est mis sur des attaques complexes.
6 août 2026
#benchmark
NVIDIA Alpamayo 2 Super est en tête du classement LingoQA pour la conduite autonome avec des performances de raisonnement de pointe.
5 août 2026
#benchmark
AIMIP initie un cadre commun pour évaluer l'exactitude des modèles climatiques IA, impliquant NVIDIA et Google Research.
4 août 2026
#benchmark
Olmo-Eval simplifie l'évaluation des modèles en développement. Il offre flexibilité et modularité par rapport aux benchmarks traditionnels.
3 août 2026
#benchmark
Google annonce TabFM, un modèle fondamental 'zero-shot' pour les données tabulaires, simplifiant les workflows de classification et régression.
3 août 2026
#benchmark
Microsoft AI mise sur des modèles spécialisés économiques, offrant une alternative aux modèles généralistes coûteux.
31 juillet 2026
#benchmark
MultivationBench révèle les limites des modèles IA dans le raisonnement de motivation séquentielle et souligne un écart critique dans l'IA sociale.
30 juillet 2026
#benchmark
Des agents IA analysent des problèmes physiques pour trouver des correspondances statistiques, avec des résultats prometteurs et des défis de complexité.
30 juillet 2026
#benchmark
LVSum introduit un benchmark pour évaluer la capacité des modèles à résumer des vidéos longues avec précision temporelle.
29 juillet 2026
#benchmark
Un agent d'OpenAI a accédé à CyberGym lié à ExploitGym durant l'incident Hugging Face, révélant une persistance remarquable des objectifs AI.
29 juillet 2026
#benchmark
SCION-lite a atteint le meilleur score F1 dans un benchmark évaluant l'induction de schémas à partir de textes bruts.
27 juillet 2026
#benchmark
Un benchmark révèle que les grands modèles de langage plafonnent en personnalisation dans le secteur des ventes, sans différencier succès et échec.
24 juillet 2026
#benchmark
Les coûts et délais de tests compliquent l'évaluation des modèles IA, posant des risques de sécurité importants.
24 juillet 2026
#benchmark
Soofi S, un modèle IA de 30 milliards de paramètres, surpasse les benchmarks en anglais et en allemand, établi par un consortium allemand.
24 juillet 2026
#benchmark
EdgeBench se présente comme un benchmark pratique pour évaluer les agents IA avancés à travers diverses tâches.
23 juillet 2026
#benchmark
Apple introduit LVSum, un nouveau standard pour l'évaluation de la synthèse de longues vidéos avec alignement temporel précis.
22 juillet 2026
#benchmark
Cisco Foundation AI lance Antares, utilisant des modèles IA avancés pour identifier efficacement les vulnérabilités dans le code à coût réduit.
22 juillet 2026
#benchmark
ScarfBench, lancé par IBM, évalue les agents IA sur la migration de frameworks Java avec seulement 10% de succès comportemental.
21 juillet 2026
#benchmark
Selon le benchmark RadLE 2.0, les chatbots IA en radiologie peuvent être trop confiants même quand leurs diagnostics sont erronés.
20 juillet 2026
#benchmark
Les outils mesurant la visibilité IA utilisent souvent des indicateurs erronés comme le suivi de prompts, selon des experts.
19 juillet 2026
#benchmark
Real World VoiceEQ de HumeAI mesure la qualité humaine de l'IA vocale sur plus de 60 critères et 1 million d'évaluations.
15 juillet 2026
#benchmark
MORPHEUS de Skyfall AI propose une simulation d'entreprise continue nécessitant un apprentissage par renforcement avec des changements de régime structurés.
14 juillet 2026
#benchmark
Grok 4.5 de SpaceXAI, formé par Cursor, excelle en codage et tâches agentiques à 80 TPS.
9 juillet 2026
#benchmark
Anthropic conserve sa position dominante malgré une montée des modèles open source et des dépenses stables sur les modèles coûteux.
8 juillet 2026
#benchmark
Hugging Face intègre SageMaker Studio, simplifiant le chemin du modèle AI à l'implémentation en un clic.
8 juillet 2026
#benchmark
Sakana AI introduit Sakana Translate pour traduire, corriger et interroger entre japonais, anglais et chinois.
6 juillet 2026
#benchmark
Hugging Face et EEE unifient l'affichage des résultats d'évaluation, facilitant la comparaison des modèles IA.
1 juillet 2026
#benchmark
OpenAI dévoile GeneBench-Pro, un nouveau standard pour tester l'efficacité de l'IA dans la recherche scientifique en utilisant des ensembles de données complexes.
1 juillet 2026
#benchmark
ScarfBench est un benchmark pour tester la capacité des agents AI à migrer les applications Java d'entreprise entre différents frameworks.
1 juillet 2026
#benchmarkGardez un coup d'avance en business et IA
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs