Yann LeCun : son réseau neuronal de 1989 ressuscité sur Mac
2 min · 15 août 2026

Yann LeCun : son réseau neuronal de 1989 ressuscité sur Mac

Par Arthur Dekeyser

En résumé

1

Le réseau de 1989 classait des chiffres manuscrits avec 7 291 images 16 × 16 et environ 1 000 neurones.

2

La réimplémentation PyTorch a réduit trois jours d’entraînement sur SUN-4/260 à environ 90 secondes sur un MacBook Air M1.

3

L'implémentation moderne a obtenu un taux d'erreur de 4,09 % sur le jeu de test.

💡

Le signal : Le réseau de Yann LeCun entraîné en 1989 passe de trois jours à environ 90 secondes sur un MacBook Air M1.

RAPPORT STRATÉGIQUE

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs

Le réseau de LeCun rejoué sur Mac

Le papier Backpropagation Applied to Handwritten Zip Code Recognition, publié par Yann LeCun et ses coauteurs en 1989, décrit une application concrète d’un réseau neuronal entraîné de bout en bout par rétropropagation. Le travail utilise 7 291 images de chiffres manuscrits en niveaux de gris, chacune au format 16 × 16, et un réseau d’environ 1 000 neurones. Il présente déjà les éléments familiers d’un article moderne de deep learning: jeu de données, architecture, fonction de perte, optimisation et taux d’erreur mesurés sur les ensembles d’entraînement et de test.

Pour étudier les progrès réalisés en 33 ans, l’auteur a réimplémenté le modèle en PyTorch dans le dépôt GitHub karpathy/lecun1989-repro, en essayant de suivre le papier au plus près. Le réseau original avait été développé en Lisp avec le simulateur de rétropropagation SN, créé par Bottou et LeCun en 1988, puis renommé Lush. Le document évoque déjà une description de réseaux avec une interface de haut niveau, proche de celle proposée aujourd’hui par PyTorch.

90 secondes contre trois jours

L’entraînement original nécessitait 23 passages sur les 7 291 exemples, soit 167 693 présentations d’un exemple et de son étiquette au réseau. Il avait duré trois jours sur une station SUN-4/260. La réimplémentation a réalisé le même parcours sur le processeur d’un MacBook Air équipé d’une puce M1 en environ 90 secondes, soit une accélération naïve d’environ 3 000 fois. Un GPU A100 s’est toutefois montré plus lent, probablement parce que le modèle est minuscule: un réseau convolutif de quatre couches, jusqu’à 12 canaux, 9 760 paramètres, 64 000 opérations MAC et 1 000 activations.

Les résultats reproduisent les performances historiques sans les égaler exactement. Le papier original rapporte une erreur de 0,14 % sur l’entraînement et de 5,00 % sur le test, contre 0,62 % et 4,09 % dans la réimplémentation. Une reproduction exacte est probablement impossible, car le jeu de données d’origine semble avoir été perdu. L’auteur l’a remplacé par des exemples de MNIST en 28 × 28, réduits en 16 × 16 par interpolation bilinéaire. Des incertitudes subsistent aussi sur l’initialisation des poids, les connexions clairsemées entre certaines couches, la variante exacte de la tangente hyperbolique et l’algorithme de Newton utilisé à l’époque. La réimplémentation emploie plus simplement la descente de gradient stochastique.

AdamW et augmentation réduisent l’erreur

L’expérience a ensuite remplacé la sortie en tangente hyperbolique et la perte MSE par des logits de classes et une entropie croisée multiclasses. L’erreur d’entraînement est alors tombée à 0 %, mais l’erreur de test a atteint 4,38 %.

Enfin, l’implémentation moderne a utilisé l’optimiseur AdamW avec un taux d’apprentissage de 3e-4. L’erreur d’entraînement s’établissait alors à 1,70 %, contre 0 % auparavant, dans une expérience destinée à limiter le surapprentissage.

L’implémentation moderne a utilisé le dataset MNIST pour simuler le dataset original.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs

À lire aussi