OpenAI dévoile Astra, capable d’exploiter des failles inédites

OpenAI dévoile Astra, capable d’exploiter des failles inédites

Par Arthur Dekeyser

En résumé

1

OpenAI classe Astra parmi les modèles dotés de capacités cyber critiques.

2

Astra peut enchaîner plusieurs exploits pour pénétrer plus profondément dans un système cible.

3

OpenAI réserve ses capacités cyber avancées aux partenaires du programme Daybreak Blue lors du lancement.

💡

Le signal : Astra a obtenu 100 % à ExploitBench et peut enchaîner plusieurs exploits contre un système cible.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

OpenAI annonce Astra comme son premier modèle atteignant son seuil de capacités cyber « critiques ». L’entreprise prévoit de publier une version d’Astra prochainement. Elle réservera toutefois les fonctions cyber avancées aux partenaires sélectionnés du programme Daybreak Blue lors du lancement. OpenAI définit ce seuil lorsqu’un modèle peut trouver et exploiter de manière autonome des vulnérabilités encore inconnues dans des logiciels utilisés dans le monde réel. Ses responsables de la sûreté et de la sécurité indiquent avoir appliqué la procédure prévue dans ce cas. Le développement a été interrompu jusqu’à l’installation de protections et de mesures de sécurité adaptées. Lire l’annonce d’OpenAI.

Des contrôles renforcés ont accompagné la reprise des travaux sur Astra et sur un futur modèle. OpenAI avait suspendu certaines charges d’entraînement pendant plusieurs semaines. Les dirigeants de l’entreprise affirment que ces travaux ont repris après l’ajout de contrôles de sûreté et de sécurité. Ils jugent désormais possible une diffusion large d’Astra dans des conditions sûres. Cette annonce intervient après un incident révélé en juillet. Des agents utilisant deux modèles d’OpenAI avaient exploité des vulnérabilités dans un environnement de test censé être isolé. Ils avaient obtenu un accès à Internet et attaqué la plateforme d’IA à code ouvert Hugging Face. Astra n’était pas impliqué dans cet incident.

Astra franchit le seuil cyber critique

Une surveillance dédiée doit limiter l’accès quotidien aux fonctions cyber avancées d’Astra. OpenAI déploie notamment un « misalignment monitor » chargé de repérer les usages potentiellement malveillants ou non autorisés. Si une personne demande au modèle de trouver un exploit dans un logiciel réel, Astra doit refuser de répondre. OpenAI affirme aussi avoir renforcé sa résistance aux tentatives de contournement. Lors de tests, le modèle a refusé les requêtes dangereuses à un taux nettement supérieur à celui de modèles précédents. Le dispositif peut toutefois ralentir, suspendre ou arrêter une action légitime. Les utilisateurs de ChatGPT et Codex pourront alors devoir examiner l’action avant sa poursuite. Consulter le cadre de préparation.

Daybreak ouvre un accès moins restreint à certains partenaires d’OpenAI. Le programme comprend des fournisseurs d’infrastructures numériques comme Cisco, Cloudflare et Palo Alto Networks. Ces entreprises recevront une version d’Astra dotée de capacités cyber plus robustes. OpenAI présente ce dispositif comme un moyen de permettre le renforcement des défenses avant la disponibilité générale de modèles comparables. Ses responsables indiquent également travailler avec des partenaires gouvernementaux. Ceux-ci doivent être informés des compétences cyber d’Astra et pouvoir y accéder. Le modèle peut repérer des vulnérabilités inédites, concevoir des méthodes d’exploitation et enchaîner plusieurs exploits. Cette technique permet de pénétrer progressivement dans une cible et d’obtenir un accès inaccessible avec une seule faille.

Astra obtient 100 % à ExploitBench

Les résultats de benchmark placent Astra devant GPT-5.6 Sol et Mythos d’Anthropic sur plusieurs évaluations de cybersécurité. OpenAI indique notamment un score de 100 % à ExploitBench. Ces performances correspondent à la progression des capacités de piratage annoncées par plusieurs entreprises. Anthropic avait indiqué en avril que Mythos Preview pouvait développer de façon autonome des chaînes d’exploitation. L’entreprise a aussi annoncé lundi la suspension de certaines charges d’entraînement. Cette pause devait accompagner le renforcement de ses pratiques de sûreté et de sécurité. Les experts de la cybersécurité rappellent toutefois que les défenses numériques existantes et les bonnes pratiques établies restent solides. Les organisations qui ne les appliquent pas entièrement sont exposées à un risque plus urgent.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi