Le MIT innove pour traquer l'IA générant du contenu illégal
#open-source 2 min · 8 août 2026

Le MIT innove pour traquer l'IA générant du contenu illégal

Par Arthur Dekeyser

En résumé

1

Les chercheurs du MIT ont créé une technique pour tester les IA génératives sans produire de contenu illégal.

2

Cette méthode a identifié avec précision les modèles adaptés pour produire des images illégales.

3

La technique, appelée sondage gaussien, est scalable et peu coûteuse à mettre en œuvre.

💡

Le signal : Le MIT a créé une méthode d'audit détectant les IA générant du CSAM avec 100% de précision.

RAPPORT STRATÉGIQUE

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs

Les chercheurs du MIT ont développé un nouveau procédé d’audit pour tester les modèles d’IA générative. Ce système permet de vérifier si un modèle IA a été modifié pour produire du contenu illégal, sans générer d’images illicites. Cette innovation est importante pour identifier les modèles IA modifiés pour créer du matériel comme le CSAM, un problème croissant selon les experts. Par exemple, en 2025, le National Center for Missing and Exploited Children a reçu plus de 1,5 million de rapports de CSAM générés par IA, une augmentation par rapport aux 67 000 en 2024.

Le défi technique a été relevé en collaborant avec l’organisation à but non lucratif Thorn, spécialisée dans la protection des enfants. Les chercheurs ont ainsi contourné l’illicéité de générer du CSAM pour tester les capacités néfastes des modèles IA existants. Le papier de recherche, dirigé par Vinith Suriyakumar et présenté à l’atelier “Trustworthy AI for Good”, détaille cette nouvelle approche. Leur travail démontre que la méthode atteint une précision de 100% pour l’identification de modèles spécialisés dans la production de ce type de contenu.

Modifications détectées dans les modèles

En 2023, une étude menée par l’équipe a révélé que 85% des modèles analysés présentaient des modifications subtles mais significatives, ce qui a permis de mieux comprendre les mécanismes de spécialisation des modèles IA.

Modifications détectées dans les modèles

Les chercheurs ont analysé les adaptations effectuées par un algorithme de type LoRA lors de la spécialisation d’un modèle. En testant leurs hypothèses à travers une approche appelée sondage gaussien, ils ne génèrent jamais d’images, évitant ainsi toute production de contenu illicite. Cette méthode a été comparée à des données de référence issues de modèles connus pour générer du CSAM, et s’est avérée extrêmement efficace.

Plans futurs et implications

Les chercheurs prévoient de publier un rapport détaillé en 2024 sur l’efficacité de cette technique à travers différents types de modèles IA. L’objectif à long terme est de tester cette technique sur un ensemble plus large de variantes de modèles et d’explorer son potentiel pour détecter des capacités nuisibles dans les modèles de base avant qu’ils ne soient adaptés. Les chercheurs espèrent que cette approche technologique contribuera à réduire l’impact négatif des IA sur les enfants, comme expliqué par Marzyeh Ghassemi dans l’article publié sur MIT News. Avec ce système, les plateformes hébergeant des modèles en open-source disposent d’un outil pour repérer et supprimer rapidement les versions nuisibles.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs

À lire aussi