En résumé
Ai2 et l’Université de Washington ont organisé un défi scientifique avec 25 équipes étudiantes.
AutoDiscovery a généré des hypothèses, mais les étudiants ont dû vérifier les preuves et la littérature.
Les résultats ont varié selon les données, avec environ 15 pistes exploitables sur des mesures réelles de réacteurs.
Le signal : À l’Université de Washington, 10 équipes ont évalué AutoDiscovery sur des données de batteries, polymères, protéines et réacteurs nucléaires.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Ai2 et l’Université de Washington ont organisé au printemps 2026 le défi GenAI for Science: Ai2-UW Materials Challenge. Vingt-cinq équipes ont proposé un jeu de données et une question de recherche. Dix équipes ont ensuite travaillé plusieurs semaines avec AutoDiscovery, l’agent d’Ai2 dédié à la recherche scientifique. L’outil analyse des données, propose des hypothèses, mène des expériences et classe les résultats selon la surprise bayésienne. Cette mesure compare la prédiction du modèle avec les observations. Les étudiants ont étudié des batteries, des polymères, des protéines sensibles à la lumière et des configurations de réacteurs nucléaires. Lire la présentation d’Ai2.
Le rôle des étudiants est resté central pendant chaque projet. Les équipes ont testé les hypothèses contre les preuves disponibles. Elles ont repéré des lacunes dans le raisonnement d’AutoDiscovery et mesuré la réduction réelle du travail manuel. Les enseignants et les chercheurs d’Ai2 ont sélectionné les projets selon la richesse des données, leur caractère distinctif et leur potentiel scientifique. Ils ont parfois réduit le périmètre de jeux de données trop vastes. L’objectif pédagogique consistait à apprendre une exploration scientifique avec l’IA, plutôt qu’à déléguer une tâche définie. Les étudiants ont donc comparé les résultats avec des travaux publiés et évalué leur solidité.
Les batteries lithium-ion ont fourni un exemple de corrélation à vérifier. Une équipe a observé que les tests diagnostiques périodiques pourraient accélérer la dégradation d’une cellule. Les données ne démontraient toutefois pas que ces tests provoquaient cette usure supplémentaire. Une expérience contrôlée constituait donc l’étape logique suivante. Sur six millions de simulations de polymères, une autre équipe a trouvé une exception apparente à une règle vieille de plusieurs décennies. Deux méthodes d’estimation de la charge atomique divergeaient sur certains atomes, notamment l’oxygène et l’azote. Les étudiants ont retrouvé l’article initial et identifié une question encore ouverte concernant les polymères.
Les protéines photosensibles ont montré une concordance entre l’outil et les résultats expérimentaux des étudiants. Le groupe cherchait où insérer un segment sensible à la lumière pour activer une protéine. AutoDiscovery a distingué les insertions fonctionnelles des autres à partir de leurs caractéristiques. Les insertions efficaces ancraient le segment en quelques points solides, plutôt qu’en plusieurs points faibles. Ce motif apparaissait dans chaque conception testée en laboratoire. Il correspondait aussi à un principe établi de liaison des protéines. Les réacteurs nucléaires ont fourni un contre-exemple. Sur 24 000 configurations simulées, environ la moitié des hypothèses étaient illogiques et aucune ne méritait d’être poursuivie.
Les mesures réelles de physique des réacteurs ont produit un résultat différent. Sur ces relevés expérimentaux, AutoDiscovery a fait émerger environ 15 pistes potentiellement intéressantes. Les étudiants ont ensuite évalué leur plausibilité physique et leur cohérence logique. Ils ont vérifié les plus solides dans la littérature. Ils ont aussi décidé lesquelles justifiaient une analyse supplémentaire. La différence entre les simulations et les mesures réelles venait du fonctionnement de l’outil. AutoDiscovery évalue la surprise à partir de mesures du monde réel. Des nombres synthétiques ont donc perturbé son analyse. Cette expérience montre que la qualité des données influence directement l’utilité des hypothèses générées.
L’évaluation humaine est ressortie comme la conclusion commune des projets. AutoDiscovery a surtout proposé des idées que les étudiants n’auraient peut-être pas testées. Il n’a pas supprimé le rôle du chercheur. Les équipes ont dû lire les preuves, comprendre le raisonnement et distinguer découverte, coïncidence ou problème de données. Luna Yue Huang, professeure associée à l’Université de Washington, estime que la pensée critique, la conception expérimentale, le raisonnement scientifique et la justification des conclusions restent des responsabilités humaines. En dix jours, les étudiants ont produit des hypothèses accompagnées de revues bibliographiques, d’analyses quantitatives, de plans de validation et de rapports argumentés. Essayer AutoDiscovery.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés