Red Teaming
Le red teaming IA consiste à tenter délibérément de faire échouer, biaiser ou contourner un modèle IA pour identifier ses vulnérabilités avant déploiement. C'est une pratique de sécurité proactive adoptée par tous les grands labs d'IA.
Avant le lancement de GPT-4, OpenAI a mobilisé plus de 300 testeurs externes pour tenter de faire générer au modèle des contenus dangereux et identifier les failles à corriger avant la mise en production.
Le red teaming IA consiste à tenter délibérément de faire échouer, biaiser ou contourner un modèle IA pour identifier ses vulnérabilités avant déploiement. C'est une pratique de sécurité proactive adoptée par tous les grands labs d'IA.
Avant le lancement de GPT-4, OpenAI a mobilisé plus de 300 testeurs externes pour tenter de faire générer au modèle des contenus dangereux et identifier les failles à corriger avant la mise en production.
Red teaming et Guardrails sont deux concepts liés mais distincts dans l'écosystème IA. Pour approfondir : Guardrails, Alignement IA, Jailbreak, Sûreté de l'IA.
Gardez un coup d'avance en business et IA
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés