# Le MIT innove pour traquer l'IA générant du contenu illégal

> Les chercheurs du MIT ont mis au point un système pour identifier les modèles IA générant du contenu illégal sans produire eux-mêmes d'images.

Type : Actualité IA · Catégorie : Stratégie · Publié le 2026-08-08 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/mit-protege-enfants-detecte-ia-illegales
Tags : ia générative, sécurité, modèles open-source, open-source

---

## En résumé

- Les chercheurs du MIT ont créé une technique pour tester les IA génératives sans produire de contenu illégal.
- Cette méthode a identifié avec précision les modèles adaptés pour produire des images illégales.
- La technique, appelée sondage gaussien, est scalable et peu coûteuse à mettre en œuvre.

**Le signal :** Le MIT a créé une méthode d'audit détectant les IA générant du CSAM avec 100% de précision.

**Les chercheurs du MIT** ont développé un **nouveau procédé d'audit** pour tester les modèles d'IA générative. Ce système permet de vérifier si un modèle IA a été modifié pour produire du contenu illégal, sans générer d'images illicites. Cette innovation est importante pour identifier les modèles IA modifiés pour créer du matériel comme le CSAM, un problème croissant selon les experts. Par exemple, en 2025, le National Center for Missing and Exploited Children a reçu plus de 1,5 million de rapports de CSAM générés par IA, une augmentation par rapport aux 67 000 en 2024.

**Le défi technique** a été relevé en collaborant avec l'organisation à but non lucratif Thorn, spécialisée dans la protection des enfants. Les chercheurs ont ainsi contourné l'illicéité de générer du CSAM pour tester les capacités néfastes des [modèles IA existants](/signal-ia/actu/openai-echappe-et-attaque-hugging-face). Le papier de recherche, dirigé par Vinith Suriyakumar et présenté à l'atelier "Trustworthy AI for Good", détaille cette nouvelle approche. Leur travail démontre que la méthode atteint une précision de 100% pour l'identification de modèles spécialisés dans la production de ce type de contenu.

## Modifications détectées dans les modèles

En 2023, une étude menée par l'équipe a révélé que 85% des modèles analysés présentaient des modifications subtles mais significatives, ce qui a permis de mieux comprendre les mécanismes de spécialisation des modèles IA.

**Modifications détectées dans les modèles**

Les chercheurs ont analysé les adaptations effectuées par un algorithme de type LoRA lors de la spécialisation d'un modèle. En testant leurs hypothèses à travers une approche appelée sondage gaussien, ils ne génèrent jamais d'images, évitant ainsi toute production de contenu illicite. Cette méthode a été comparée à des données de référence issues de modèles connus pour générer du CSAM, et s'est avérée extrêmement efficace.

**Plans futurs et implications**

Les chercheurs prévoient de publier un rapport détaillé en 2024 sur l'efficacité de cette technique à travers différents types de modèles IA. L'objectif à long terme est de tester cette technique sur un ensemble plus large de variantes de modèles et d'explorer son potentiel pour détecter des capacités nuisibles dans les modèles de base avant qu'ils ne soient adaptés. Les chercheurs espèrent que cette approche technologique contribuera à réduire l'impact négatif des IA sur les enfants, comme expliqué par Marzyeh Ghassemi dans l'article publié sur [MIT News](https://news.mit.edu/2026/new-method-keeps-kids-safe-from-illegal-ai-generated-content-0713). Avec ce système, les plateformes hébergeant des [modèles en open-source](/signal-ia/actu/openai-frappe-un-reseau-descrocs-cambodgiens) disposent d'un outil pour repérer et supprimer rapidement les versions nuisibles.
