# Le MIT détecte les IA pédocriminelles sans générer de CSAM

> Le MIT a créé une technique d'audit pour tester les capacités nuisibles des modèles d'IA sans générer de contenu illégal.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-08-17 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/mit-protege-enfants-du-contenu-illegal-par-ia
Tags : sécurité des enfants, intelligence artificielle, modèles génératifs, open-source

---

## En résumé

- Le MIT a développé une technique d'audit qui détecte les capacités nuisibles des modèles d'IA sans générer de contenu.
- En 2025, plus de 1,5 million de rapports d'IA générative de contenu pédopornographique ont été enregistrés.
- La technique d'audit utilise des sondages Gaussiens pour analyser les adaptations des modèles, avec une précision de 100%.

**Le signal :** Le Centre National a reçu 1,5 million de rapports d'IA CSAM en 2025.

**Le MIT** a mis au point une nouvelle technique pour tester les modèles d'IA génératifs afin de détecter des capacités nuisibles, sans générer de contenu illégal. Cette méthode a été développée par l'équipe de l'Associate Professor Ashia Wilson et son étudiant diplômé, Vinith Suriyakumar, en collaboration avec le laboratoire Healthy ML du MIT et l'organisation Thorn, spécialisée dans la [sécurité](/signal-ia/actu/openai-des-ia-pirates-autonomes-defient-la-cybersecurite) des enfants. Leur technique vérifie les adaptations internes des modèles, permettant ainsi d'identifier ceux qui sont conçus pour produire des contenus pédopornographiques (CSAM) sans les générer eux-mêmes. Ce développement pourrait révolutionner la manière dont les modèles IA sont évalués pour la sécurité des enfants ([source](https://news.mit.edu/2026/new-method-keeps-kids-safe-from-illegal-ai-generated-content-0713)).

**Le contexte** de cette avancée est marqué par une augmentation spectaculaire des signalements de contenus pédopornographiques générés par IA. En 2025, le National Center for Missing and Exploited Children a reçu plus de 1,5 million de rapports sur de tels contenus, contre 67 000 l'année précédente. Les méthodes traditionnelles, consistant à inciter les modèles à produire ces contenus pour les évaluer, sont non seulement illégales mais également peu efficaces à grande échelle. En réponse, le MIT et ses partenaires ont conçu une approche non générative qui évalue les modifications subies par un modèle lors du processus de fine-tuning, une technique de spécialisation exploitable à des fins malveillantes.

## Auditer sans générer

**La méthode** développée par l'équipe utilise une technique appelée sondage Gaussien. Elle permet de sonder les ajustements internes apportés par des algorithmes tels que LoRA (low-rank adaptation). En injectant des données aléatoires dans un modèle, les chercheurs capturent et analysent les modifications internes à plusieurs étapes. Ces ajustements fournissent des indices fiables sur la spécialisation du modèle à produire du contenu nuisible. Les tests ont montré que cette approche identifie avec une précision de 100% les modèles adaptés à la génération de CSAM, en les comparant à des données de base provenant d'adaptations connues [publiées ici](https://arxiv.org/pdf/2604.25119).

L'intérêt de cette technique réside également dans sa **scalabilité**, essentielle face au grand nombre de modèles en [code ouvert](/signal-ia/actu/code-ouvert-lia-dentreprise-bouleverse-openai) disponibles en ligne. Le professeur Wilson souligne que de nombreuses adaptations dangereuses peuvent rester non détectées si elles ne sont pas correctement auditées. L'intégration réussie de ce système pourrait aider les plateformes d'hébergement à identifier et à retirer rapidement les modèles potentiellement nocifs.

## Avancées technologiques attendues

**Les prochaines étapes** incluront l'application de cette technique d'audit sur un ensemble de modèles encore plus vaste, ainsi que l'investigation de son efficacité sur les modèles de base avant qu'ils ne soient adaptés. Le développement continu de cette technologie pourrait potentiellement réduire l'impact négatif de l'IA sur la sécurité des enfants à l'échelle mondiale. Marzyeh Ghassemi, membre de l'équipe, espère que ces efforts déboucheront sur des améliorations significatives dans la protection des enfants contre l'exploitation via l'IA. Pour en savoir plus sur l'initiative, vous pouvez visiter [Thorn](https://www.thorn.org/) qui a collaboré activement au projet.
