13 IA recréent Mario sans voir la moindre image
#benchmark #deepseek #qwen 3 min · 31 août 2026

13 IA recréent Mario sans voir la moindre image

Par Arthur Dekeyser

En résumé

1

Pixel32Bench a soumis 13 modèles à 53 essais sur une grille de 32×32 pixels.

2

Les modèles retiennent surtout la casquette rouge, la salopette bleue et la moustache de Mario.

3

Le coût, le temps de génération et le niveau de réflexion ne garantissent pas une meilleure ressemblance.

💡

Le signal : Pixel32Bench a testé 13 modèles sur 53 essais, dont 41 ont produit une image techniquement valide de Mario.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Pixel32Bench compare 13 modèles de langage chargés de recréer Mario sur une grille de 32 × 32 pixels. L’expérience, publiée par TheMoonMidas le 22 août 2026, ne fournit aucune image de référence aux modèles. Chaque système doit représenter le plombier seul, en pied et centré, sur un fond uni. Il ne produit pas directement une illustration. Il renvoie une couleur de fond et 32 lignes de données correspondant aux 1 024 pixels de la grille. Un programme vérifie ensuite le format avant de convertir la réponse en image. Les résultats vont d’un Mario immédiatement reconnaissable à des assemblages de pixels chaotiques. Voir les résultats publiés sur X.

Le protocole impose une consigne identique à chaque modèle, sans exemple, conversation préalable ou visuel fourni. Pixel32Bench affiche le modèle utilisé, son niveau de « réflexion », l’image obtenue, le coût de la requête et le temps de génération. Cette présentation permet de comparer plusieurs configurations d’un même système. Elle ne transforme toutefois pas les résultats en classement. TheMoonMidas réalise un seul essai par configuration et n’attribue aucune note aux créations. Le développeur Simon Willison avait déjà mené une expérience comparable en 2024, en demandant à des modèles de langage de générer le code d’un pélican à vélo. Le projet Pixel32Bench reprend cette logique de reconstruction.

Les modèles convergent vers Mario

Les résultats comptent 53 essais réalisés avec 13 modèles issus notamment d’OpenAI, Anthropic, Google, xAI, DeepSeek et Qwen. Parmi ces tentatives, 41 ont produit une image techniquement valide. Les 12 autres ont été interrompues avant la fin ou n’ont pas respecté le format demandé. Les créations valides présentent des écarts importants de ressemblance. Certaines évoquent clairement Mario, tandis que d’autres ressemblent seulement à des blocs de couleurs. La plupart des modèles convergent néanmoins vers plusieurs marqueurs visuels. Ils associent le personnage à une casquette rouge, un haut rouge, une salopette bleue et des chaussures brunes. Le nez proéminent et la moustache dominent aussi le visage.

Le coût ne prédit pas la qualité visuelle obtenue. Pixel32Bench montre qu’une génération plus chère ou plus longue ne produit pas forcément le Mario le plus convaincant. Le même constat apparaît lorsque l’utilisateur compare plusieurs niveaux de « réflexion » pour un modèle donné. Le niveau le plus élevé ne fournit pas systématiquement le personnage le plus reconnaissable. Les variations entre images peuvent être importantes pour une même famille de modèles. Ces observations restent illustratives, car chaque configuration n’est testée qu’une seule fois. Elles montrent cependant que les indicateurs de coût, de durée et de réflexion ne suffisent pas à évaluer la ressemblance d’une création en pixel art.

Une reconstruction fondée sur des associations

Les images suggèrent que les modèles reconstruisent Mario à partir d’associations apprises pendant leur entraînement. L’expérience ne montre donc pas littéralement ce que les IA auraient « dans la tête ». Elle met plutôt en évidence les attributs qu’elles semblent relier au personnage. Le rouge, le bleu, la casquette et la moustache reviennent dans la majorité des résultats. La contrainte de 1 024 pixels force chaque modèle à sélectionner quelques signes distinctifs. Pixel32Bench rend ces choix visibles, sans mesurer leur fidélité par une note. Le projet compare ainsi des réponses produites pixel après pixel, plutôt que des images générées à partir d’une référence existante.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi