Google présente TimesFM-3, un modèle de 330 millions de paramètres qui prévoit plusieurs séries temporelles avec covariables, en un seul passage.
8 septembre 2026
GPT-6 Astra a terminé les 48 niveaux de I’m Not a Robot, relançant le débat sur l’efficacité des captchas face aux IA capables d’agir à l’écran.
8 septembre 2026
SpaceXAI a lancé Grok 4.6 le 13 août 2026, avec un score de 61 et un tarif de 2 à 6 dollars par million de jetons.
8 septembre 2026
Perplexity décrit Ivy, Tulip et ROSE, trois services Rust et Python qui servent pplx-embed avec graphes CUDA et exécution asynchrone.
7 septembre 2026
Capsule Security a lancé le 2 septembre un coupe-circuit IA capable d’évaluer et de bloquer une action d’agent autonome en 71 millisecondes.
4 septembre 2026
Ai2 publie olmo-eval, un atelier ouvert qui compare les checkpoints, orchestre les évaluations multi-tours et analyse les écarts entre modèles.
3 septembre 2026
BenchMIRT, présenté le 1er septembre 2026, audite les performances de 100 modèles sur 16 benchmarks et plus de 34 000 questions.
3 septembre 2026
LexisNexis rachète Doctrine, Mistral prépare une levée de 3 milliards d’euros et Nvidia acquiert Hugging Face pour 12,9 milliards.
3 septembre 2026
Shama Hyder recommande un suivi hebdomadaire du GEO, alors que 68 % des recherches Google américaines se terminent sans clic selon SparkToro.
3 septembre 2026
Instinct a levé 250 millions de dollars, devant Owner et Generalist AI, dans une semaine américaine dominée par les outils et assistants IA.
2 septembre 2026
Microsoft Research présente Orchard, un framework en code ouvert qui entraîne et évalue des agents IA dans des environnements réutilisables.
2 septembre 2026
Ai2 et Hugging Face triplent le stockage dédié à près de deux pétaoctets et suppriment les limites de débit pour les téléchargements.
1 septembre 2026
Lilian Weng enrichit son guide sur les Transformers avec une version deux fois plus longue, couvrant attention, mémoire et encodage positionnel.
1 septembre 2026
Mistral a publié Agentic Search le 20 août 2026, une couche de recherche qui atteint 86 % de précision sur FinanceBench avec GLM-5.2.
1 septembre 2026
Pixel32Bench a comparé 13 modèles chargés de recréer Mario en 32×32 pixels, sans image de référence, avec 41 résultats techniquement valides.
31 août 2026
Anthropic présente un système automatisé qui améliore un modèle sur 10 benchmarks d’alignement, sans dégrader ses performances générales.
31 août 2026
Benu Aggarwal propose un cadre en trois couches pour rendre une marque accessible, compréhensible, crédible et actionnable par les moteurs d’IA.
27 août 2026
Depuis le 16 août, DeepSeek facture certains postes jusqu’à douze fois plus cher, selon les données d’Artificial Analysis citées par Leptidigital.
27 août 2026
Hack The Box observe que les meilleures équipes humaines ont terminé les 36 défis, tandis que la meilleure équipe augmentée par IA s’est arrêtée à 32.
27 août 2026
Maddyness publie le MAD30 AI Backbone, un palmarès de 30 personnalités qui construisent les infrastructures et usages de l’IA en France.
27 août 2026
Thomson Reuters affirme que son modèle propriétaire Thomson rivalise avec les meilleurs modèles d’IA, après un développement lancé avec Safe Sign Technologies.
27 août 2026
Z.ai lance GLM-5.3-Flash, un modèle de 320 milliards de paramètres, facturé 0,09 dollar par tâche et évalué à 57 points.
27 août 2026
Microsoft présente Flint, un langage intermédiaire ouvert qui transforme des spécifications simples en graphiques soignés pour plusieurs bibliothèques.
26 août 2026
Microsoft Research publie Orchard, un cadre ouvert qui entraîne des agents IA dans Codex, OpenClaw et ZeroClaw, avec des modèles compacts.
26 août 2026
Bellman-Ford sert de modèle pour aligner des réseaux neuronaux graphiques sur des algorithmes classiques et tester leur généralisation hors distribution.
25 août 2026
Google présente TabFM, un modèle fondation pour classifier et régresser sur des tableaux, avec prédictions zero-shot en un seul passage.
25 août 2026
NVIDIA annonce jusqu’à 30 fois plus de débit par mégawatt pour Vera Rubin NVL72 que GB300 NVL72 sur les charges d’IA agentique.
25 août 2026
Nvidia annonce la production complète du rack Groq 3 LPX, issu d’une acquisition de 20 milliards de dollars, avec un déploiement prévu cette année.
25 août 2026
Anthropic observe huit fois plus de code fusionné en 2026 qu’en 2021-2024, tandis que SocioHack et des drones testent les limites de l’IA.
24 août 2026
Anthropic atteint 65 milliards de dollars de revenus annualisés en juillet 2026, tandis qu’Opus 5 ne représente que 3,5 % de ses dépenses modèles.
24 août 2026
SpaceXAI a lancé Grok 4.6 le 13 août 2026, avec un score de 61 et un tarif annoncé de 2 dollars par million de tokens.
24 août 2026
Harvey présente Tenet, un modèle Kimi K3 post-entraîné avec Fireworks, qui double presque les tâches réussies sur son évaluation juridique.
24 août 2026
Le procès Musk contre Altman a commencé le 5 mai 2026, tandis qu’OpenAI a clos le risque juridique de Microsoft lié à son accord Amazon.
24 août 2026
Qwen 3.8 27B d’Alibaba tient dans 17 Go et excelle en vision et en code, mais son raisonnement xhigh ralentit fortement les usages locaux.
24 août 2026
Ai2 publie olmo-eval, un atelier ouvert pour évaluer les modèles à chaque étape, comparer les points de contrôle et distinguer progrès réel et bruit.
18 août 2026
Les entreprises américaines les plus dépensières consacrent 7 400 dollars par salarié à l’IA, contre 11,95 dollars pour l’entreprise médiane.
18 août 2026
PYMNTS indique que l’IA d’entreprise progresse surtout dans les fonctions aux données structurées et aux résultats mesurables, notamment la finance.
18 août 2026
Apple présente ARBITRAGE, un cadre innovant pour améliorer l'efficience des modèles de langage, réduisant la latence d'inférence de moitié.
15 août 2026
Workiva révèle que 26 % des dirigeants ont vu des erreurs d’IA atteindre des publics externes ou des conseils d’administration, malgré une confiance élevée.
15 août 2026
Au 2 août 2026, Artificial Analysis place Claude Opus 5 devant GPT-5.6 Sol dans son classement des modèles d'IA fondé sur neuf évaluations.
14 août 2026
DeepAmbigQA évalue la complétude des réponses de LLM sur 3 600 questions combinant ambiguïté de nom et raisonnement en plusieurs étapes.
14 août 2026
Kimi K3 est troisième au classement mondial, mais Claude Fable 5 reste devant malgré une interruption de 19 jours imposée à Anthropic.
14 août 2026
Sebastian Raschka présente quatre méthodes d'évaluation des LLM, dont MMLU, les vérificateurs, les classements et les juges fondés sur des modèles.
14 août 2026
Mpathic publie mPACT, un benchmark clinique qui montre que Claude, GPT-5.2 et Gemini évitent mieux les risques, sans atteindre le niveau attendu en crise.
14 août 2026
ONESTRUCTION lance Ishigaki-IDS, un modèle innovant qui améliore les workflows BIM et atteint près de 100 % de conformité structurelle XML.
13 août 2026
Google présente TabFM, un modèle qui transforme l'analyse des données tabulaires, rendant obsolètes l'entraînement manuel et l'optimisation hyperparamétrique.
10 août 2026
L'outil olmo-eval d'Allen Institute simplifie l'évaluation continue des modèles de langage en développement, facilitant ainsi l'optimisation des performances des modèles IA.
10 août 2026
Thomson Reuters a développé un grand modèle linguistique nommé Thomson, performant à la hauteur de Claude Opus 4.8 et surpassant GPT-5.5.
7 août 2026
Gardez un coup d'avance en business et IA
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés