En résumé
Le NTK relie les gradients du réseau à l’évolution de ses sorties.
La paramétrisation utilise un facteur 1/√n_l pour éviter une divergence.
Les réseaux de largeur infinie sont étudiés pour caractériser la convergence.
Le signal : Le NTK de Jacot et al. décrit l’effet d’une mise à jour des paramètres sur les prédictions d’autres exemples.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Jacot et al. Le noyau tangent neural, ou NTK, formalise l’évolution des réseaux neuronaux entraînés par descente de gradient. L’article de Lilian Weng présente ses bases mathématiques et sa définition. Le NTK mesure comment une mise à jour des paramètres influence les prédictions produites pour d’autres exemples. Cette approche s’intéresse aux réseaux surparamétrés, capables d’atteindre une perte d’entraînement proche de zéro. Elle examine aussi des situations où le nombre de paramètres dépasse le nombre de données d’entraînement. Les travaux de Jacot et al. en 2018 constituent le point de départ théorique présenté. Lire l’article complet de Lilian Weng.
Le cadre mathématique Un réseau entièrement connecté possède des paramètres θ et transforme un vecteur d’entrée de dimension n₀ en une sortie de dimension n_L. Pour une fonction vectorielle, sa dérivée forme une matrice jacobienne. Le réseau contient P paramètres, avec P égal à la somme des paramètres de poids et de biais entre les couches. Chaque couche applique une transformation affine, puis une non-linéarité σ supposée lipschitzienne. Les paramètres sont initialisés selon une loi gaussienne indépendante de moyenne nulle et de variance unitaire. L’article rappelle aussi le théorème central limite, les développements de Taylor et les méthodes à noyau.
La définition centrale La perte empirique moyenne les coûts calculés sur N exemples d’entraînement. La règle de la chaîne exprime son gradient comme une somme de gradients de la sortie du réseau. En considérant des mises à jour suffisamment petites, l’évolution des paramètres devient une équation différentielle temporelle. L’évolution de la sortie dépend alors du produit entre deux gradients par rapport aux paramètres. Ce produit définit le noyau tangent neural, noté K(x, x’; θ). Pour deux entrées, il additionne les produits des dérivées de chaque sortie par rapport aux P paramètres. La carte de caractéristiques associée à une entrée est donc le gradient du réseau.
La paramétrisation contrôlée Dans chaque couche, la transformation des activations utilise un facteur 1/√n_l devant la matrice de poids. Cette rescale évite une divergence lorsque la largeur du réseau tend vers l’infini. Un scalaire β contrôle la contribution des biais. Le cadre considère des couches indexées de 0 à L, avec n₀ neurones d’entrée et n_L neurones de sortie. L’analyse porte sur des réseaux dont les poids et les biais suivent des lois gaussiennes indépendantes. Elle étudie ensuite pourquoi les réseaux de largeur infinie fournissent un cadre pour caractériser la convergence vers un minimum global lors de la minimisation d’une perte empirique.
Le lien probabiliste Les réseaux neuronaux profonds présentent un lien avec les processus gaussiens, étudié notamment par Neal en 1994. Dans ce cadre, les sorties des réseaux sont décrites comme des processus gaussiens centrés. Leur covariance, notée Σ^(L), est construite récursivement à partir des couches. Chaque entrée du noyau de covariance compare deux points de données. Lorsque cette valeur indique une forte similarité, les sorties associées sont rapprochées dans le modèle probabiliste. Les processus gaussiens définissent ainsi une distribution sur des fonctions, puis actualisent cette distribution après observation de données. L’article relie cette construction au comportement des réseaux profonds.
La suite théorique L’analyse présentée se concentre sur les démonstrations du NTK et sur la convergence déterministe obtenue pour des réseaux de largeur infinie. Elle introduit aussi l’idée de modèles linéarisés autour de l’initialisation et de l’entraînement paresseux. Le développement de Taylor fournit une approximation de premier ordre de la fonction autour d’un point de départ. Les méthodes à noyau, elles, prédisent une nouvelle sortie par somme pondérée des étiquettes d’entraînement. Le NTK réunit ces éléments en utilisant les gradients du réseau comme représentation des entrées. Les références incluent l’article fondateur de Jacot et ses coauteurs, publié en 2018, ainsi que des rappels sur les noyaux et les processus gaussiens. Voir l’article fondateur sur arXiv. Explorer les processus gaussiens.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés