Unit 42 repère les neurones qui font refuser Qwen3-4B
Cybersécurité #ia-entreprise 3 min · 21 septembre 2026

Unit 42 repère les neurones qui font refuser Qwen3-4B

Par Arthur Dekeyser

En résumé

1

Unit 42 introduit le sondage par perturbation pour analyser les circuits de sécurité des LLM.

2

Cinquante neurones modifient le format de réponse de Qwen3-4B dans 80 % de 520 tests nuisibles.

3

Le ratio FFN/Skip explique 81 % de la variance de vulnérabilité observée sur 13 modèles.

💡

Le signal : Unit 42 montre que 50 neurones sur 350 208 contrôlent le format de refus de Qwen3-4B.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Unit 42 publie une méthode appelée « perturbation probing » pour examiner la fragilité des mécanismes de sécurité des grands modèles de langage. Cette méthode utilise seulement deux passages dans le modèle par requête. Elle identifie les neurones feed-forward responsables d’un comportement ciblé, comme le refus de demandes nuisibles. Les chercheurs présentent ces résultats dans une étude académique consacrée aux circuits comportementaux internes des modèles alignés. Leur objectif est de mesurer où se trouve l’alignement et s’il repose sur une défense concentrée ou distribuée. L’étude prolonge un précédent travail de Unit 42 sur le pilotage par écart de logits, qui analysait le contournement des garde-fous.

Le modèle Qwen3-4B fournit le résultat central de l’étude. Les chercheurs identifient 50 neurones parmi 350 208 neurones feed-forward, soit environ 0,014 % de cet ensemble. La suppression de ces neurones modifie le format de réponse dans 80 % des 520 tests standards portant sur des requêtes nuisibles. Le résultat est reproduit sur 200 requêtes d’un second test standard. Sur Qwen3.5-2B, 20 neurones suffisent à supprimer un accord erroné avec les utilisateurs dans des conversations à plusieurs tours. Ce comportement passe de 36,7 % à 0 % sur 30 questions. Ces observations associent une petite partie du réseau à des comportements de sécurité ciblés.

Unit 42 mesure les circuits internes

Le ratio FFN/Skip complète l’identification des neurones. Unit 42 le présente comme un indicateur calculable en quelques secondes par modèle. Il mesure la part des décisions acheminée par une voie interne étroite. Sur les 13 modèles testés, ce ratio explique 81 % de la variance de vulnérabilité observée après une petite modification ciblée. Les auteurs le présentent comme un candidat pour une mesure quantitative de la fragilité de la sécurité. Cette mesure permettrait de comparer la robustesse de l’alignement entre modèles, sans commencer par des campagnes de tests offensifs. L’étude décrit donc un diagnostic, plutôt qu’une preuve générale sur tous les modèles existants.

Les auteurs recommandent d’utiliser le sondage par perturbation avant le déploiement d’un modèle. Les équipes de sécurité peuvent mesurer la part de la sécurité reposant sur une couche interne facilement modifiable. La même méthode a aussi servi à renforcer un comportement ciblé. Sur un petit modèle, l’amplification de 10 neurones identifiés améliore l’auto-correction factuelle de 52 % à 88 % sur 200 requêtes TruthfulQA, sans nouvel entraînement. Unit 42 indique vouloir permettre des propriétés de sécurité mesurées, auditées et renforcées. L’étude est disponible dans l’article arXiv consacré au perturbation probing, cité par les chercheurs.

Les garde-fous externes restent nécessaires

La stratégie préconisée repose sur plusieurs couches de défense. Unit 42 estime qu’une couche interne concentrée ne doit pas constituer l’unique protection d’un modèle déployé. L’étude recommande d’ajouter des filtres de contenu externes et des garde-fous actifs pendant l’exécution. Pour les organisations, Unit 42 cite Prisma AIRS Runtime Security pour ces contrôles externes. Elle cite également AI Security Assessment pour examiner les risques de gouvernance et d’exposition liés à l’adoption de l’IA. Les travaux publiés portent sur des modèles ouverts évalués localement, avec des résultats agrégés et des résumés non opérationnels.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi