En résumé
Yann LeCun et ses coauteurs ont appliqué la rétropropagation à la reconnaissance de codes postaux manuscrits en 1989.
Andrej Karpathy a reproduit l’expérience avec PyTorch sur un jeu de données dérivé de MNIST.
L’augmentation des données et le dropout ont réduit l’erreur de test jusqu’à 1,59 %.
Le signal : Andrej Karpathy réduit l’erreur de test de 4,09 % à 1,59 % avec AdamW, l’augmentation des données et le dropout.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Une expérience fondatrice En 1989, Yann LeCun et ses coauteurs publiaient une application de la rétropropagation à la reconnaissance de codes postaux manuscrits. Leur système analysait 7 291 images de chiffres en niveaux de gris, chacune mesurant 16 par 16 pixels. Le réseau neuronal comptait environ 1 000 neurones. Le papier décrivait déjà le jeu de données, l’architecture, la fonction de perte, l’optimisation et les erreurs sur les ensembles d’entraînement et de test. Andrej Karpathy considère ce travail comme une des premières applications concrètes d’un réseau entraîné de bout en bout par rétropropagation. Son analyse complète cette mise en perspective dans son article.
Un modèle compact Le réseau original était un réseau convolutif à quatre couches, avec jusqu’à 12 canaux. Il totalisait 9 760 paramètres, 64 000 opérations de multiplication-accumulation et 1 000 activations. L’entraînement nécessitait 23 passages sur les 7 291 exemples, soit 167 693 présentations d’un exemple et de son étiquette. Sur une station SUN-4/260, cette procédure durait trois jours. Karpathy a réimplémenté l’expérience avec PyTorch dans un dépôt GitHub. Son MacBook Air équipé d’une puce M1 a réalisé le même entraînement en environ 90 secondes sur processeur. Le gain mesuré atteint environ 3 000 fois, sans utiliser le processeur graphique ni le processeur neuronal.
Des écarts mesurés Le papier original rapportait une erreur d’entraînement de 0,14 % et une erreur de test de 5,00 %, avec respectivement 10 et 102 erreurs. La reproduction de Karpathy obtenait 0,62 % sur l’entraînement et 4,09 % sur le test, soit 45 et 82 erreurs. Cette comparaison n’est pas exacte, car la reproduction utilise MNIST. Karpathy a redimensionné des chiffres de 28 par 28 pixels en images de 16 par 16 pixels, puis a sélectionné les exemples nécessaires. Il signale aussi des descriptions techniques ambiguës dans le papier, notamment pour l’initialisation des poids, les connexions clairsemées et l’algorithme de Newton utilisé à l’époque.
Les outils modernes progressent Karpathy a d’abord remplacé la perte quadratique par une entropie croisée multiclasses, supprimé la tangente hyperbolique en sortie et obtenu 4,38 % d’erreur de test. Le passage à AdamW, avec un taux d’apprentissage décroissant de 3e-4 à 1e-4, a ensuite ramené cette erreur à 3,59 %. L’augmentation des données par décalage des images jusqu’à un pixel, puis l’ajout d’un dropout de 0,25 et le remplacement de tanh par ReLU, ont réduit l’erreur à 1,59 %. Le test comptait alors 32 erreurs sur 2 007 exemples. Le temps d’entraînement aurait toutefois presque quadruplé, passant de trois à près de douze jours sur le matériel de 1989.
Un jeu sept fois plus grand Karpathy a également utilisé 50 000 exemples d’entraînement issus de MNIST, contre 7 291 dans l’expérience initiale. Cette multiplication par environ sept a amélioré la performance sans modifier la latence d’inférence. Avec les techniques modernes combinées, le système atteint 1,25 % d’erreur sur le test, soit 24 erreurs. L’entraînement affiche alors 1,07 % d’erreur. Cette expérience compare une reproduction fondée sur un jeu de données dérivé à une version enrichie par davantage d’exemples. Elle montre aussi que les gains observés ne proviennent pas uniquement de l’architecture. Les choix de perte, d’optimisation et de régularisation modifient également les résultats mesurés.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés