Par Arthur Dekeyser
En résumé
Les chercheurs ont développé une procédure pour tester les modèles IA génératifs pour leurs capacités nuisibles sans générer de sorties.
L'augmentation des signalements de contenus illégaux générés par IA a atteint 1,5 million en 2025, selon le National Center for Missing and Exploited Children.
Cette nouvelle méthode utilise un audit interne des adaptations du modèle sans passer par la génération d'images illégales.
Le signal : En 2025, plus de 1,5 million de signalements d'images CSAM générées par IA ont été enregistrés aux États-Unis, selon le National Center for Missing and Exploited Children.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs
Mise au point par le MIT, une nouvelle méthode d’audit permet de tester les modèles d’IA génératifs pour détecter leurs capacités nuisibles sans produire de contenus illégaux. Cette avancée pourrait aider à identifier les modèles en open-source modifiés pour générer des contenus tels que le CSAM (Child Sexual Abuse Material). Les chercheurs ont travaillé avec l’ONG Thorn pour développer cette approche qui n’engendre pas de sorties, mais qui examine les représentations internes des modèles afin de déterminer s’ils ont été spécialisés à des fins nuisibles. Lire l’article
Le contexte de la menace est préoccupant : avec l’essor de l’IA générative, de nombreux modèles accessibles via des plateformes peuvent être modifiés pour des tâches spécifiques. En 2025, le National Center for Missing and Exploited Children a reçu plus de 1,5 million de signalements d’images CSAM générées par IA aux États-Unis, un chiffre en forte augmentation par rapport à 2024.
Chiffres et résultats : L’approche développée par les chercheurs inclut l’utilisation de Gaussien probing, qui analyse comment un modèle traite des données aléatoires pour déceler les adaptations effectuées par des algorithmes spécifiques (LoRA adaptors). Cette méthode s’est avérée 100% efficace pour identifier les modèles adaptés à la génération de CSAM, sans générer de contenus illégaux. Cette avancée permettrait aux plateformes hébergeant des modèles open-source de marquer et retirer rapidement ceux identifiés comme dangereux.
Implications et applications : Pour les PME et les gestionnaires de contenu numérique, cette technique représente un outil critique pour garantir la sécurité digitale. En anticipant les modifications malveillantes, elle pourrait éviter la distribution large de contenus illégaux sur les plateformes.
Positionnement concurrentiel : En comparaison, d’autres méthodes d’audit nécessitent l’analyse du contenu généré par les modèles, une approche impraticable pour les contenus illégaux. La robustesse et l’évolutivité de cette nouvelle technique la distinguent en rendant inefficace toute tentative de modification insidieuse des modèles.
Perspectives futures : Les chercheurs projettent d’évaluer leur méthode sur un plus vaste ensemble de modèles et de déterminer si elle peut identifier les capacités malveillantes des modèles de base avant qu’ils ne soient adaptés. Le potentiel de transformation de leur approche sur la sécurité des enfants est très prometteur. Pour plus d’informations sur le travail des chercheurs, consultez leur page dédiée. Pour aller plus loin, consultez notre guide sur les usages de l’IA en marketing digital pour PME.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs
On utilise des cookies de mesure d'audience (Google Analytics, Meta, PostHog) pour comprendre ce qui t'intéresse et améliorer le site. Tu décides. En savoir plus