Andrej Karpathy préconise de surajuster un seul lot
3 min · 21 septembre 2026

Andrej Karpathy préconise de surajuster un seul lot

Par Arthur Dekeyser

En résumé

1

Andrej Karpathy présente l’entraînement neuronal comme une abstraction qui fuit.

2

Les réseaux neuronaux peuvent apprendre malgré des erreurs de configuration silencieuses.

3

La méthode commence par les données avant de construire un modèle complexe.

💡

Le signal : Andrej Karpathy recommande de surajuster un seul lot avant d'ajouter de la complexité au modèle.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Andrej Karpathy propose une méthode progressive pour entraîner des réseaux neuronaux et réduire les erreurs difficiles à repérer. Son point de départ est double. L’entraînement neuronal reste une abstraction imparfaite dès qu’un problème s’éloigne d’un cas standard. Les bibliothèques peuvent masquer une complexité importante derrière quelques lignes de code. Le fonctionnement du modèle doit donc rester compris par l’équipe qui l’utilise. Karpathy insiste aussi sur les échecs silencieux. Un code peut être correct sur le plan syntaxique, puis produire un modèle mal configuré. Le réseau continue alors souvent son entraînement, mais avec des performances dégradées. La patience et l’attention aux détails deviennent des qualités déterminantes.

Les erreurs restent discrètes dans de nombreuses étapes de préparation et d’entraînement. Une augmentation d’image peut inverser l’image sans inverser son étiquette. Un modèle autorégressif peut utiliser par erreur la valeur qu’il doit prédire. Un réglage peut couper la fonction de perte au lieu des gradients. Une initialisation depuis un modèle préentraîné peut aussi oublier la moyenne utilisée initialement. Karpathy cite également les forces de régularisation, le taux d’apprentissage, sa décroissance et la taille du modèle. Ces paramètres créent une large surface d’erreurs logiques. Les exceptions ne signalent donc pas toujours le problème. Une approche rapide et improvisée augmente le temps nécessaire pour trouver la cause réelle.

Karpathy commence par les données

L’inspection précède le modèle dans la méthode proposée. Karpathy recommande d’examiner des milliers d’exemples pendant plusieurs heures afin de comprendre leur distribution. Cette revue peut révéler des doublons, des images corrompues ou des étiquettes incorrectes. Elle sert aussi à repérer les déséquilibres, les biais et le niveau de bruit des annotations. L’analyse doit examiner la variation utile, la variation parasite et l’importance du contexte global. Des scripts simples peuvent ensuite filtrer, trier et visualiser les exemples selon leurs étiquettes, leurs annotations ou leur taille. Les valeurs atypiques constituent un signal important. Elles exposent souvent des défauts dans les données ou dans leur prétraitement.

Le squelette reste minimal lors de l’étape suivante. Karpathy conseille d’abord un classifieur linéaire ou un très petit réseau convolutif, plutôt qu’une architecture sophistiquée. L’équipe doit fixer la graine aléatoire et désactiver les augmentations de données. Elle doit évaluer la perte sur l’ensemble du jeu de test, avec suffisamment de chiffres significatifs. La perte initiale doit aussi correspondre à une valeur attendue. La dernière couche doit recevoir une initialisation cohérente avec la moyenne des sorties. Une comparaison avec une performance humaine peut compléter cette vérification. Un modèle dont les entrées sont remplacées par des zéros sert enfin de référence indépendante des entrées.

Le test décisif consiste à surajuster un seul lot contenant seulement quelques exemples, parfois deux. Le modèle doit alors atteindre la perte minimale possible et aligner ses prédictions sur les étiquettes. Si cet alignement échoue, la suite du développement doit attendre. Karpathy recommande aussi de vérifier que la perte d’entraînement diminue lorsque la capacité augmente légèrement. Les données doivent être visualisées immédiatement avant leur entrée dans le modèle, car ce tenseur constitue le point de contrôle le plus fiable. Les prédictions d’un lot de test fixe doivent être suivies pendant l’entraînement. Leurs oscillations peuvent révéler une instabilité ou un taux d’apprentissage trop élevé ou trop faible. Cette recette est détaillée dans l’article d’Andrej Karpathy, avec des références à son explication de la rétropropagation.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi