Les mathématiques redéfinissent leur rôle en machine learning
3 min · 15 août 2026

Les mathématiques redéfinissent leur rôle en machine learning

Par Arthur Dekeyser

En résumé

1

Les méthodes qui augmentent les données, le calcul et le nombre de paramètres produisent des capacités que les théories existantes n’avaient pas anticipées.

2

Un réseau de 7 milliards de paramètres et 50 couches ne peut pas être compris par sa seule précision, car ses propriétés hors distribution ou sa robustesse peuvent varier.

3

La topologie, l’algèbre et la géométrie élargissent les outils utilisés pour étudier les modèles et leurs espaces de paramètres.

💡

Le signal : Un réseau de 7 milliards de paramètres et 50 couches ne se laisse pas résumer par un seul score de précision.

RAPPORT STRATÉGIQUE

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs

Le calcul redessine la recherche

Au cours de la dernière décennie, les progrès du machine learning se sont déplacés. Les architectures soigneusement conçues et fondées sur des principes mathématiques n’apportent souvent que des améliorations marginales, tandis que les approches centrées sur l’ingénierie, capables d’exploiter des volumes croissants de données d’entraînement et de paramètres, produisent de nouvelles capacités que les théories existantes n’avaient pas anticipées. Ce mouvement renouvelle la « Bitter Lesson »: l’avantage revient de plus en plus aux méthodes qui passent à l’échelle.

Les mathématiques et les statistiques, autrefois guides principaux de la recherche, peinent ainsi à offrir une compréhension immédiate des dernières avancées. Leur rôle ne disparaît pas pour autant, selon les auteurs. Il évolue: les mathématiques pourraient davantage servir à expliquer après coup des phénomènes empiriques observés pendant l’entraînement et dans les performances des modèles, à la manière de leur utilisation en physique. L’intuition mathématique pourrait aussi se déplacer de la conception détaillée des caractéristiques et des architectures vers des choix plus généraux, comme l’adéquation entre une architecture, la structure d’une tâche et les symétries des données.

Les modèles dépassent leurs scores

Cette évolution s’inscrit dans une histoire plus longue. Les réseaux convolutionnels équivariants par translation, qui associent l’architecture aux symétries des données, ont plus de 40 ans. Ce qui change, ce sont surtout les problèmes auxquels les mathématiques peuvent apporter le plus et les usages qui en sont faits. La montée en puissance du calcul élargit également les domaines mobilisés: la topologie, l’algèbre et la géométrie rejoignent les champs plus traditionnellement appliqués que sont les probabilités, l’analyse et l’algèbre linéaire.

Pour analyser un réseau de 7 milliards de paramètres et 50 couches, mesurer sa précision sur des benchmarks ne suffit pas nécessairement. Deux modèles de vision affichant la même précision peuvent présenter des propriétés très différentes en matière de généralisation à des données hors distribution, de calibration ou de robustesse face aux attaques adversariales. Les activations cachées permettent de suivre directement la transformation d’une entrée brute en prédiction, mais elles sont généralement de grande dimension et peu structurées pour l’intuition humaine. L’espace des poids est encore plus difficile à appréhender, avec des millions ou des milliards de directions possibles depuis un même point de départ.

Les mathématiques structurent l’invisible

Les auteurs comparent cette situation à la fable des trois aveugles qui décrivent chacun un éléphant à partir d’une seule partie de son corps. Les méthodes actuelles d’analyse des activations et des poids reviendraient à tenter de décrire l’animal avec le contact d’une simple aiguille. La recherche mathématique peut alors contribuer en aidant d’abord à formuler les bonnes questions, puis en construisant des outils pour rendre traitables des objets difficiles à visualiser.

L’exemple des rotations illustre cette démarche. On peut étudier cet ensemble par l’algèbre linéaire, par son action sur Rⁿ ou avec l’intuition géométrique: SO(n) forme, dans toute dimension n, une variété qui ressemble localement à un espace euclidien, tout en pouvant présenter à grande échelle des torsions, des trous ou d’autres propriétés non euclidiennes. Le même type d’outils vise à éclairer les réseaux neuronaux: les modèles à base de ReLU découpent l’espace d’entrée en d’innombrables régions polygonales, où le modèle se comporte comme une application linéaire. La mathématique ne fournit donc plus seulement des garanties; elle devient aussi un instrument pour caractériser ce que l’on ne peut pas directement visualiser.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs

À lire aussi