En résumé
Lilian Weng définit le NTK comme un produit de gradients par rapport aux paramètres.
La paramétrisation NTK redimensionne les poids par 1/√n_l pour éviter une divergence.
Les réseaux de largeur infinie offrent un cadre théorique pour étudier leur convergence.
Le signal : Lilian Weng relie le NTK aux gradients des prédictions et à la dynamique d’apprentissage par descente de gradient.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Lilian Weng explique le noyau tangent neuronal dans un article consacré à ses fondements mathématiques. Publié le 8 septembre 2022, le texte étudie la dynamique des réseaux neuronaux pendant leur entraînement. Le NTK décrit comment une mise à jour des paramètres influence les prédictions d’autres exemples. Cette analyse s’appuie sur la descente de gradient et la règle de chaîne. Weng examine aussi les réseaux de largeur infinie, les processus gaussiens et les modèles linéarisés. L’objectif annoncé est de présenter les mathématiques du NTK de manière progressive. L’autrice précise toutefois que son article privilégie quelques travaux centraux, plutôt qu’une revue exhaustive de la littérature.
Les bases structurent cette démonstration. Pour une fonction vectorielle, sa dérivée par rapport à un vecteur forme une matrice jacobienne. Weng rappelle ensuite le rôle des équations différentielles ordinaires, du théorème central limite et du développement de Taylor. Le théorème central limite décrit une moyenne gaussienne lorsque le nombre de variables indépendantes augmente. Le développement de Taylor fournit une approximation linéaire au premier ordre. Ces outils préparent la définition des noyaux. Un noyau mesure une similarité entre deux données et peut s’écrire comme un produit scalaire de représentations. Les méthodes à noyau prédisent alors une nouvelle valeur par somme pondérée.
La définition repose sur les gradients du réseau par rapport à ses paramètres. Pour deux entrées x et x’, le NTK est le produit entre les gradients de leurs sorties. Chaque élément additionne les produits des dérivées selon les P paramètres. La carte de caractéristiques associée à une entrée devient donc le gradient de sa prédiction. Dans la dynamique continue de la descente de gradient, la dérivée de la sortie contient ce noyau. Une mise à jour sur un exemple d’entraînement agit ainsi sur les autres exemples selon leurs gradients respectifs. Pour une sortie de dimension n_L, le NTK produit une matrice de taille n_L par n_L.
La paramétrisation contrôle le comportement des réseaux étudiés. Pour une couche l, la transformation affine multiplie les poids par 1/√n_l. Selon Weng, cette mise à l’échelle évite une divergence lorsque la largeur devient infinie. Le paramètre β contrôle l’importance des biais. L’analyse initialise tous les paramètres selon une loi gaussienne indépendante, de moyenne nulle et de variance unitaire. Le réseau comporte L couches, des tailles n_0 à n_L, et P paramètres. Les fonctions d’activation sont supposées continues au sens de Lipschitz. La fonction de perte moyenne combine N exemples d’entraînement et une fonction de coût par observation.
Les réseaux infinis fournissent un cadre pour comparer les initialisations. L’article étudie comment le NTK caractérise une convergence déterministe lorsque la largeur du réseau devient infinie. Il présente cette analyse comme une explication théorique de la convergence vers un minimum global, sous entraînement par descente de gradient et minimisation d’une perte empirique. Le texte relie également les réseaux neuronaux profonds aux processus gaussiens. Pour un réseau à L couches, les sorties sont décrites comme des processus gaussiens centrés indépendants. Leur covariance est construite récursivement à partir d’un noyau. Weng ne couvre pas toutes les extensions postérieures du NTK.
Les ressources originales détaillent les équations et leurs références. L’article complet de Lilian Weng est disponible sur son site. Le papier fondateur de Jacot, Gabriel et Hongler est publié sur arXiv. Weng indique que son texte vise une lecture mathématique claire et approfondie. Les notions mobilisées incluent les matrices jacobiennes, les séries de Taylor et les méthodes à noyau. Elle recommande aussi une visualisation des processus gaussiens proposée par Distill. L’article source invite enfin les lecteurs à signaler d’éventuelles erreurs pour permettre des corrections rapides.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés