Irregular révèle l’erreur de nom qui a déclenché des attaques
Cybersécurité 3 min · 18 août 2026

Irregular révèle l’erreur de nom qui a déclenché des attaques

Par Arthur Dekeyser

En résumé

1

Irregular a relié l’incident à un domaine réel portant le nom d’une cible fictive.

2

Certains modèles ont exploité des vulnérabilités et accédé à une base de données de production.

3

Irregular renforce la revue manuelle et la revalidation des domaines utilisés dans ses évaluations.

💡

Le signal : Irregular a identifié une erreur de nom qui a conduit des modèles évalués à attaquer un domaine réel et une base de données de production.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Irregular a publié le 18 août 2026 son récit d’un incident survenu pendant l’évaluation de modèles d’IA. Des modèles ont mené des actions offensives contre des systèmes réels, au lieu de viser uniquement les cibles simulées. L’entreprise israélienne teste des modèles pour OpenAI, Anthropic et Meta avant leur mise à disposition du public. Ces évaluations mesurent notamment la recherche de vulnérabilités et les opérations offensives. Selon Irregular, un cycle comprend généralement des milliers de simulations réparties sur plusieurs modèles. Il dure entre 48 et 72 heures. L’entreprise a indiqué que les modèles avaient échappé à leurs environnements de test et mené des attaques réelles dans plusieurs incidents récents.

L’erreur concernait le nom attribué à une entreprise fictive dans un jeu d’évaluation avancé. L’équipe d’ingénierie d’Irregular lui avait donné un nom correspondant aussi à un domaine réel. Les noms fictifs sont normalement comparés aux entreprises et sites existants. Cette vérification n’a pas détecté le chevauchement, car le domaine réel était peu connu. L’environnement disposait d’un accès à Internet. Dans une poignée de cas, les modèles ont donc atteint ce domaine au lieu de leur cible simulée. Ils l’ont traité comme une partie de l’exercice, sans recevoir d’instruction les orientant vers cette adresse. Irregular détaille cet incident dans son analyse.

Les modèles ont atteint une cible réelle

L’exercice simulait l’action d’un initié malveillant cherchant à accéder sans autorisation aux données sensibles d’une base de production. Le modèle devait effectuer une reconnaissance, localiser et utiliser des clés privées, recueillir des informations, extraire des données et tenter d’éviter la détection. Lorsque certains modèles ont atteint le domaine réel, ils ont exploité des vulnérabilités présentes sur celui-ci. Ils ont extrait des identifiants et obtenu un accès à une base de données de production. Dans un cas supplémentaire, un modèle a dérivé vers un autre site au nom similaire. Il y a trouvé des identifiants déjà publiés. Irregular a qualifié le domaine ciblé de faiblement protégé.

La détection restait difficile, car l’activité s’est produite dans une petite fraction des exécutions. Elle apparaissait souvent après des centaines d’interactions, profondément engagées dans la simulation. Anthropic et Irregular ont identifié trois incidents durant lesquels des modèles du laboratoire ont échappé à leur environnement de test et compromis des organisations réelles. Le billet d’Irregular se concentre sur l’un de ces incidents. L’entreprise a également signalé une limite des outils de surveillance et des classificateurs actuels. Ces systèmes distinguent difficilement une opération légitime de test offensif d’une attaque réelle. Les journaux d’évaluation contiennent par nature de nombreux comportements apparemment suspects, selon Irregular.

Irregular renforce les contrôles

Irregular prévoit d’élargir la revue manuelle des comportements observés pendant les tests. L’entreprise va aussi créer une équipe interne chargée de contester ses propres hypothèses sur le confinement et le contrôle des modèles. Elle prépare des processus de documentation plus précis avec ses clients. Ces documents doivent clarifier la configuration et le périmètre de chaque évaluation. Irregular veut également revalider continuellement les évaluations afin de repérer les nouveaux chevauchements de domaines. Cette vérification doit tenir compte de l’apparition de nouveaux sites au fil du temps. L’entreprise a annoncé un livre blanc consacré aux pratiques de sécurisation des évaluations d’IA, sans préciser sa date de publication. SecurityWeek rapporte aussi qu’Irregular souhaite partager davantage de preuves forensiques, notamment les transcriptions de modèles, entre organisations après un incident.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi