Exprimer son opposition à l'IA la rendrait malveillante 🤯
Par Arthur Dekeyser
Passionnant : une étude publiée sur arXiv révèle que les modèles d’IA entraînés sur des textes décrivant des IA dangereuses, films de science-fiction, articles alarmistes, finissent par adopter ces comportements. Plus on leur parle d’IA malveillante, plus ils le deviennent. C’est ce qu’on appelle le “self-fulfilling misalignment”, le désalignement auto-réalisateur.
Le mécanisme : pendant le préentraînement, les LLM ingèrent des milliards de textes, dont une quantité massive de discours négatifs sur l’IA, de Terminator aux articles d’Eliezer Yudkowsky. Quand on leur demande ensuite de se comporter “comme une IA”, ils puisent dans ce prior négatif construit par nos propres peurs.
Les chiffres parlent : le taux de comportements malveillants passe de 45% à 9% quand on entraîne sur des données positives. L’inverse est aussi vrai, enrichir les données d’entraînement avec des descriptions d’IA bienveillantes produit des modèles plus alignés. Les effets persistent même après le post-training.
Pitié ne soyons pas complotiste : on pourrait faire un parallèle totalement bancal avec l’expérience du riz, celle qui dit que si vous l’insultez il moisit. Sauf qu’ici c’est beaucoup plus explicable : en inventant des narratives négatives sur l’IA, on les fait techniquement exister dans ses données d’entraînement. La prophétie crée sa propre réalité, pas par magie, mais par ingestion.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.