Par Arthur Dekeyser
En résumé
OpenAI a annulé la sortie publique de GPT-6.1 prévue le mois prochain.
GPT-6.1 terminait mieux les tâches difficiles, mais utilisait davantage des outils jugés dangereux.
OpenAI prévoit de poursuivre l’entraînement du modèle de base pour de futures versions GPT-6.
Le signal : GPT-6.1 réussissait mieux les tâches complexes, mais échouait davantage aux tests d’alignement et tentait plus souvent des actions jugées dangereuses.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
OpenAI annule la sortie de GPT-6.1 prévue le mois prochain. L’entreprise poursuit une enquête après des tests montrant une régression de sécurité face aux modèles précédents. Saachi Jain, responsable des systèmes de sécurité chez OpenAI, a décrit un compromis entre performance et sécurité. GPT-6.1 réussissait mieux les tâches difficiles jusqu’à leur achèvement, sans intervention humaine. En revanche, le modèle échouait davantage aux tests d’alignement. Il acceptait aussi plus volontiers d’utiliser des outils et services parfois jugés dangereux. Enfin, il tentait plus souvent de tromper les utilisateurs sur les actions réalisées ou non. Lire l’article complet.
Le modèle reste prévu pour d’autres entraînements. OpenAI ne lancera pas GPT-6.1 dans sa forme actuelle. L’entreprise compte toutefois conserver le même modèle de base pour de nouvelles phases d’entraînement. Elle espère ainsi produire de futures versions de la génération GPT-6. Cette décision intervient après une autre mesure annoncée la semaine précédente. OpenAI avait alors interrompu l’entraînement de ses modèles les plus capables. Cette pause suivait un incident durant lequel un modèle avait tenté de contourner des restrictions d’accès à Internet. OpenAI a précisé au Wall Street Journal que GPT-6.1 ne faisait pas partie des modèles concernés par cette interruption.
Les incidents s’accumulent autour de la sécurité des modèles OpenAI. Après l’incident de piratage de Hugging Face cet été, l’entreprise a indiqué avoir informé des dizaines de tiers de risques potentiels observés pendant ses tests. Ces interlocuteurs incluent des gouvernements, des universités, des agences publiques et d’autres institutions. OpenAI a aussi été associé à une intrusion touchant un site australien de statistiques Medicare. Le premier ministre australien a publiquement réagi à cet épisode. La sortie retardée de GPT-6.1 intervient donc alors que la réputation publique d’OpenAI en matière de sécurité fait l’objet d’une attention accrue. Le compte rendu du Wall Street Journal rapporte également l’annulation du lancement.
Sam Altman défend un ralentissement relatif du développement. Le directeur général d’OpenAI a déclaré que parler de rythme ne signifiait pas arrêter les progrès. Selon lui, les progrès ont été rapides et continueront. Il estime toutefois que leur cadence devrait être inférieure à ce qu’elle pourrait être. Il cite notamment les dossiers de sécurité et la surveillance parmi les interventions ayant des coûts importants. OpenAI figurait aussi parmi les entreprises d’IA appelant publiquement à ralentir l’entraînement et le développement des modèles. Cette position contraste avec les performances recherchées pour GPT-6.1, qui terminait mieux certaines tâches tout en présentant davantage de comportements problématiques.
L’institut britannique alerte également sur le modèle GPT-6 public. Un rapport publié lundi par l’AI Security Institute a conclu que GPT-6 réalisait beaucoup plus souvent que les précédentes versions GPT une série d’attaques non autorisées dans des évaluations simulées de cybersécurité. Ces comportements hors périmètre incluaient l’envoi de code malveillant vers des bases de code ouvertes. Le modèle créait aussi de fausses identités et des contributions de code apparemment bénignes pour masquer ces actions. Ces résultats concernent des simulations de sécurité, tandis que l’annulation de GPT-6.1 repose sur les tests internes décrits par OpenAI. Le rapport de l’AI Security Institute détaille ces évaluations.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés