OpenAI relance les poids ouverts avec GPT-oss
#open-source 2 min · 15 août 2026

OpenAI relance les poids ouverts avec GPT-oss

Par Arthur Dekeyser

En résumé

1

gpt-oss-20b et gpt-oss-120b sont les premiers modèles à poids ouverts d’OpenAI depuis GPT-2 en 2019.

2

Les modèles remplacent notamment le dropout, les embeddings positionnels absolus et GELU par des choix désormais courants comme RoPE et Swish.

3

gpt-oss-20b peut fonctionner sur un GPU grand public de 16 Go, tandis que gpt-oss-120b vise un H100 de 80 Go ou du matériel plus récent.

💡

Le signal : gpt-oss-20b peut fonctionner sur un GPU grand public doté de 16 Go de mémoire.

RAPPORT STRATÉGIQUE

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs

OpenAI a publié cette semaine gpt-oss-120b et gpt-oss-20b, ses premiers modèles de langage à poids ouverts depuis GPT-2 en 2019. L’analyse de Sebastian Raschka, PhD, s’appuie sur le code rendu disponible et sur les rapports techniques d’OpenAI.

OpenAI revient aux poids ouverts

Les deux modèles restent des LLM de type decoder-only, construits sur l’architecture Transformer présentée dans l’article Attention Is All You Need en 2017. Selon Raschka, leur architecture générale ne présente pas, au premier regard, de rupture majeure avec les conceptions récentes. Les progrès viendraient probablement davantage des données et des améliorations algorithmiques que de changements architecturaux fondamentaux.

L’auteur avance deux explications possibles à cette convergence entre laboratoires, tout en les présentant comme de la spéculation: une rotation importante des employés entre les équipes et l’absence, à cette échelle, d’une solution ayant démontré de meilleures performances que les Transformers. Les modèles hybrides combinant Transformers et modèles à espaces d’états existent, mais Raschka souligne que les comparaisons disponibles portent surtout sur les benchmarks et ne permettent pas encore de conclure sur les tâches réelles d’écriture ou de programmation en plusieurs tours.

GPT-2 cède ses choix techniques

La comparaison avec GPT-2 met en évidence plusieurs évolutions devenues courantes. Le dropout, présent dans GPT-2, a disparu de nombreux LLM modernes. Cette technique, conçue pour limiter le surapprentissage en désactivant aléatoirement une partie des activations ou des scores d’attention, serait moins utile lorsque les modèles parcourent généralement une seule fois d’immenses jeux de données.

Les embeddings positionnels absolus des premières architectures GPT ont également été remplacés par RoPE, ou Rotary Position Embedding. Cette méthode encode la position en faisant pivoter les vecteurs de requête et de clé selon la position du token.

gpt-oss mise sur Swish et la compacité

Autre changement: GELU, utilisé par les premiers GPT, laisse place à Swish, aussi appelé SiLU, dans la famille d’activation SwiGLU. Raschka estime que Swish est légèrement moins coûteux à calculer, tandis que les écarts de performance entre les deux fonctions peuvent dépendre des hyperparamètres et rester faibles.

OpenAI indique que gpt-oss-20b peut fonctionner sur un GPU grand public disposant de 16 Go de mémoire. gpt-oss-120b peut être exécuté sur un H100 unique doté de 80 Go ou sur du matériel plus récent, avec des réserves techniques que l’auteur prévoit d’examiner.

OpenAI a publié les modèles gpt-oss-120b et gpt-oss-20b. Les modèles gpt-oss sont les premiers modèles à poids ouverts d’OpenAI depuis GPT-2 en 2019. Le modèle gpt-oss-20b peut fonctionner sur un GPU grand public avec jusqu’à 16 Go de RAM. Le modèle gpt-oss-120b nécessite un H100 avec 80 Go de RAM ou un matériel plus récent pour fonctionner.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs

À lire aussi