# MIT : une méthode audacieuse contre les IA dangereuses

> Une procédure d'audit innovante identifie les IA pouvant générer des contenus illicites sans créer ces contenus.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-07-23 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/mit-une-methode-audacieuse-contre-les-ia-dangereuses
Tags : ia, sécurité, mit, contenu illégal, audit, open-source

---

## En résumé

- Une équipe du MIT a développé une technique d'audit pour évaluer les modèles d'IA génératifs sans produire de contenus illégaux.
- La méthode utilise le « Gaussian probing » pour détecter les modèles IA adaptés pour produire des contenus nuisibles.
- Cette approche pourrait aider à identifier et supprimer les modèles dangereux avant qu'ils ne soient largement diffusés.

**Le signal :** En 2025, le National Center for Missing and Exploited Children a reçu plus de 1,5 million de rapports de CSAM générés par IA.

**Des chercheurs** du MIT ont mis au point une méthode d'audit innovante pour tester les modèles d'intelligence artificielle générative. Cette technique cible les capacités nocives des modèles sans générer de sorties illégales. L'initiative est menée par l'Associate Professor Ashia Wilson et son étudiant diplômé, Vinith Suriyakumar, en collaboration avec le Healthy ML Lab du MIT et l'organisation caritative Thorn, spécialisée dans la protection des enfants. [Source](https://news.mit.edu/2026/new-method-keeps-kids-safe-from-illegal-ai-generated-content-0713).

**Avec la montée** en popularité des [modèles en code ouvert](/signal-ia/actu/buzz-de-jack-dorsey-lia-open-source-defie-slack), ceux-ci sont de plus en plus adaptés à des fins illicites. En 2025, le National Center for Missing and Exploited Children a signalé plus de 1,5 million de cas de CSAM générés par IA, soit une augmentation significative par rapport à 67 000 cas en 2024.

**Traditionnellement**, les ingénieurs testent les modèles d'IA en les poussant à générer des contenus et en analysant les résultats. Toutefois, cette méthode est illégale lorsqu'il s'agit de CSAM. La nouvelle approche audite les modèles en examinant leurs [représentations internes](/signal-ia/actu/mit-media-lab-lia-se-devoile-avec-la-transparence-neurale) pour déterminer s'ils ont été spécialisés à des fins nocives.

**Cette avancée** permet aux plate-formes d'hébergement de repérer les modèles dangereux pour les retirer avant qu'ils ne se propagent. Jusqu'à présent, il n'existait pas de méthode efficace pour identifier de telles adaptations, et la nouvelle technique comble ce vide selon les chercheurs du MIT.

**Pour les entreprises françaises**, cette méthode est cruciale pour garantir que les modèles d'IA utilisés ou développés en interne ne soient pas détournés à des fins illégales. Cela renforce la conformité et réduit le risque réglementaire.

**En comparaison** avec d'autres techniques, le « Gaussian probing » est plus robuste, les acteurs malveillants devant modifier en profondeur le modèle de base pour éviter la détection. Cela rend son application viable et scalable sur une grande variété de variantes de modèles IA.

**Les chercheurs** projettent d'étendre cette méthode à un ensemble plus large de modèles pour évaluer son efficacité sur des capacités nuisibles avant même qu'ils ne soient adaptés. Cette étude a le potentiel de transformer la [sécurité des IA génératives](/signal-ia/actu/entrust-bouscule-ladoption-securisee-des-ia-en-entreprises), un enjeu crucial pour la société actuelle. Ce projet a été soutenu par la Bridgewater AIA Labs Research Fellowship.
