OpenAI publie ses premiers modèles ouverts depuis GPT-2
#chatgpt #open-source 2 min · 9 septembre 2026

OpenAI publie ses premiers modèles ouverts depuis GPT-2

Par Arthur Dekeyser

En résumé

1

OpenAI publie gpt-oss-120b et gpt-oss-20b, ses premiers modèles à poids ouverts depuis GPT-2.

2

Le modèle gpt-oss-20b fonctionne sur un GPU grand public avec jusqu’à 16 Go de mémoire.

3

Sebastian Raschka attribue probablement les gains principaux aux données et aux ajustements algorithmiques.

💡

Le signal : OpenAI rend gpt-oss-20b exécutable sur un GPU grand public doté de 16 Go de mémoire.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

OpenAI publie deux modèles à poids ouverts, gpt-oss-120b et gpt-oss-20b. Ils constituent les premiers modèles de ce type publiés par l’entreprise depuis GPT-2, lancé en 2019. OpenAI a conçu ces modèles pour fonctionner localement grâce à plusieurs optimisations. Cette exécution locale distingue leur positionnement technique dans la gamme récente de l’entreprise. Peu après cette publication, OpenAI a annoncé GPT-5. Les deux annonces rapprochées placent donc gpt-oss et GPT-5 dans une même séquence de produits. L’analyse de Sebastian Raschka examine les avancées architecturales entre GPT-2 et gpt-oss.

GPT-2 sert de point de comparaison depuis 2019. Les modèles gpt-oss marquent le retour d’OpenAI aux modèles à poids ouverts après cette génération. Leurs optimisations permettent une exécution locale, sans dépendre uniquement d’une infrastructure distante. Cette capacité concerne deux formats distincts, avec des exigences matérielles différentes. Le modèle gpt-oss-20b peut fonctionner sur un GPU grand public équipé de 16 Go de mémoire. Le modèle gpt-oss-120b demande davantage de ressources, mais reste exécutable sur un seul H100 doté de 80 Go de mémoire, ou sur du matériel plus récent. Ces contraintes définissent clairement leurs conditions matérielles d’utilisation.

Les modèles ciblent l’exécution locale

Les besoins matériels varient fortement entre les deux modèles. gpt-oss-20b vise une configuration accessible avec un GPU grand public disposant de 16 Go de mémoire. gpt-oss-120b nécessite un H100 avec 80 Go de mémoire, ou une plateforme plus récente. OpenAI associe donc l’exécution locale à deux niveaux de capacité matérielle. Les optimisations rendent cette exécution possible pour les deux modèles. Elles ne suppriment toutefois pas l’écart entre 20 milliards et 120 milliards de paramètres indiqué par leurs noms. Cette différence structure le choix du matériel. Elle sépare aussi l’usage sur poste équipé d’un GPU grand public de celui sur serveur doté d’un H100.

Sebastian Raschka relie les gains principalement aux données et aux ajustements algorithmiques. Selon lui, la plupart des progrès proviennent probablement de ces évolutions plutôt que de changements architecturaux majeurs. Il observe aussi que le dropout est rarement utilisé dans les grands modèles de langage modernes depuis GPT-2. Il estime que les chercheurs ont probablement constaté que cette technique n’améliorait pas réellement les performances des grands modèles de langage. Raschka rappelle également que l’encodage positionnel reste nécessaire dans les modèles de langage fondés sur les transformeurs, à cause du mécanisme d’attention. Son analyse complète est publiée sur Substack.

OpenAI rapproche modèles et matériel

La séquence associe deux annonces d’OpenAI. L’entreprise a d’abord publié gpt-oss-120b et gpt-oss-20b, puis annoncé GPT-5 peu après. Les modèles gpt-oss restent exécutables localement grâce à leurs optimisations. Le modèle 20b peut fonctionner sur un GPU grand public avec jusqu’à 16 Go de mémoire. Le modèle 120b peut fonctionner sur un H100 unique avec 80 Go de mémoire, ou sur du matériel plus récent. Ces caractéristiques donnent aux utilisateurs deux seuils matériels concrets pour tester les modèles. L’analyse de Raschka met ces modèles en regard de GPT-2 et décrit le rôle des données, des algorithmes, du dropout et de l’encodage positionnel.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi