Un benchmark révèle que les grands modèles de langage plafonnent en personnalisation dans le secteur des ventes, sans différencier succès et échec.
24 juillet 2026
#benchmark
Les coûts et délais de tests compliquent l'évaluation des modèles IA, posant des risques de sécurité importants.
24 juillet 2026
#benchmark
Soofi S, un modèle IA de 30 milliards de paramètres, surpasse les benchmarks en anglais et en allemand, établi par un consortium allemand.
24 juillet 2026
#benchmark
EdgeBench se présente comme un benchmark pratique pour évaluer les agents IA avancés à travers diverses tâches.
23 juillet 2026
#benchmark
Apple introduit LVSum, un nouveau standard pour l'évaluation de la synthèse de longues vidéos avec alignement temporel précis.
22 juillet 2026
#benchmark
Cisco Foundation AI lance Antares, utilisant des modèles IA avancés pour identifier efficacement les vulnérabilités dans le code à coût réduit.
22 juillet 2026
#benchmark
ScarfBench, lancé par IBM, évalue les agents IA sur la migration de frameworks Java avec seulement 10% de succès comportemental.
21 juillet 2026
#benchmark
Selon le benchmark RadLE 2.0, les chatbots IA en radiologie peuvent être trop confiants même quand leurs diagnostics sont erronés.
20 juillet 2026
#benchmark
Les outils mesurant la visibilité IA utilisent souvent des indicateurs erronés comme le suivi de prompts, selon des experts.
19 juillet 2026
#benchmark
Real World VoiceEQ de HumeAI mesure la qualité humaine de l'IA vocale sur plus de 60 critères et 1 million d'évaluations.
15 juillet 2026
#benchmark
MORPHEUS de Skyfall AI propose une simulation d'entreprise continue nécessitant un apprentissage par renforcement avec des changements de régime structurés.
14 juillet 2026
#benchmark
Grok 4.5 de SpaceXAI, formé par Cursor, excelle en codage et tâches agentiques à 80 TPS.
9 juillet 2026
#benchmark
Anthropic conserve sa position dominante malgré une montée des modèles open source et des dépenses stables sur les modèles coûteux.
8 juillet 2026
#benchmark
Hugging Face intègre SageMaker Studio, simplifiant le chemin du modèle AI à l'implémentation en un clic.
8 juillet 2026
#benchmark
Sakana AI introduit Sakana Translate pour traduire, corriger et interroger entre japonais, anglais et chinois.
6 juillet 2026
#benchmark
Hugging Face et EEE unifient l'affichage des résultats d'évaluation, facilitant la comparaison des modèles IA.
1 juillet 2026
#benchmark
OpenAI dévoile GeneBench-Pro, un nouveau standard pour tester l'efficacité de l'IA dans la recherche scientifique en utilisant des ensembles de données complexes.
1 juillet 2026
#benchmark
ScarfBench est un benchmark pour tester la capacité des agents AI à migrer les applications Java d'entreprise entre différents frameworks.
1 juillet 2026
#benchmark