En résumé
La recherche en IA privilégie désormais les modèles entraînés à grande échelle.
Les mathématiques peuvent expliquer après coup certains phénomènes observés.
La dimension intrinsèque aide à étudier la généralisation et les hallucinations.
Le signal : L’intrinsic dimension relie complexité des données, généralisation et détection des hallucinations.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
La recherche change rapidement. Depuis une décennie, les progrès de l’apprentissage automatique proviennent souvent d’efforts fondés sur l’ingénierie et l’augmentation de l’échelle. Ces travaux utilisent des ensembles d’entraînement toujours plus grands et davantage de paramètres. Ils produisent des capacités nouvelles que les théories existantes n’avaient pas prédites. À l’inverse, les architectures soigneusement conçues selon des principes mathématiques n’apportent parfois que des améliorations marginales. Cette situation réactive la « Bitter Lesson », selon laquelle les méthodes exploitant davantage de calcul finissent régulièrement par dépasser les approches explicitement guidées par les connaissances humaines. Les mathématiques ne disparaissent toutefois pas de la recherche en IA.
Leur rôle se déplace. Les mathématiques pourraient moins souvent fournir des garanties théoriques directes sur les performances. Elles pourraient davantage expliquer après coup des phénomènes observés pendant l’entraînement ou l’utilisation des modèles. Cette fonction rappelle leur rôle en physique. L’intuition mathématique pourrait également intervenir à un niveau plus général. Elle aiderait notamment à associer une architecture à la structure d’une tâche ou aux symétries des données. Les réseaux convolutifs équivariants par translation illustrent déjà cette idée. Cette famille d’architectures a plus de 40 ans. La transformation actuelle concerne donc surtout les problèmes auxquels les mathématiques s’appliquent et les manières de les mobiliser.
De nouveaux domaines arrivent. La progression vers des modèles plus grands élargit les champs mathématiques mobilisés par l’apprentissage automatique. La topologie, l’algèbre et la géométrie rejoignent des domaines plus traditionnellement appliqués, comme les probabilités, l’analyse et l’algèbre linéaire. Ces disciplines dites pures ont développé des outils capables de traiter des espaces, des objets algébriques et des processus combinatoires très abstraits. Elles peuvent donc contribuer à l’étude de systèmes difficiles à visualiser. Un réseau comportant 7 milliards de paramètres et 50 couches ne se résume pas à une mesure de précision. Deux modèles présentant la même exactitude peuvent différer par leur généralisation hors distribution, leur calibration ou leur robustesse aux attaques adversariales.
Les activations compliquent l’analyse. Les chercheurs peuvent accéder aux paramètres d’un modèle et extraire ses activations cachées. Ces activations permettent de suivre la transformation d’une entrée brute en prédiction. Elles restent cependant généralement de haute dimension et ne possèdent pas une structure facilement compréhensible. L’espace des poids ajoute des millions, voire des milliards, de directions orthogonales possibles depuis un même point. Une seule statistique ne suffit donc pas à décrire complètement un modèle. L’article compare cette difficulté à celle de trois personnes aveugles décrivant chacune une partie d’un éléphant. Les méthodes actuelles peuvent sembler aussi limitées lorsqu’elles examinent les poids ou les activations par une observation très ponctuelle. L’article original présente cette difficulté.
La dimension intrinsèque fournit un outil. Elle cherche à mesurer le nombre de façons indépendantes dont un jeu de données, une représentation apprise ou un ensemble de matrices de poids peut varier. L’hypothèse des variétés affirme que certaines données résident approximativement sur une variété de faible dimension, même lorsqu’elles sont plongées dans un espace de haute dimension. Des travaux ont estimé cette dimension pour des jeux de données de référence. Ils observent une corrélation apparente avec la facilité de généralisation entre entraînement et test. La dimension intrinsèque peut aussi expliquer des différences de performance et de robustesse entre domaines, notamment pour les images médicales. Elle intervient également dans certaines explications proposées des lois de changement d’échelle.
Les activations évoluent pendant le traitement. Des chercheurs ont observé que leur dimension intrinsèque change de manière caractéristique lorsque l’information traverse un modèle. Des variations ont aussi été étudiées au cours d’un processus de diffusion. Ces observations ont conduit à utiliser cette mesure pour détecter des exemples adversariaux et des contenus générés par IA. Elle sert également à repérer les couches où les activations cachées contiennent le plus d’informations sémantiques. D’autres travaux l’emploient pour étudier les hallucinations des modèles génératifs. Cette approche ne remplace pas les mesures de performance. Elle ajoute une manière de décrire la structure interne de systèmes dont les paramètres et les calculs restent difficiles à visualiser. Des exemples d’équivariance sont présentés dans Distill, tandis que la question des perceptions partielles est illustrée par cette fable.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés