# Unit 42 isole 50 neurones qui pilotent le refus de Qwen3-4B

> Unit 42 identifie 50 neurones contrôlant le refus de Qwen3-4B et propose un indicateur mesurant la fragilité des mécanismes de sécurité.

Type : Actualité IA · Catégorie : Tendances · Publié le 2026-10-02 · Signal IA - Order & Chaos · Secteur : Cybersécurité
Source : https://www.orderchaos.eu/signal-ia/actu/unit-42-revele-les-neurones-qui-fragilisent-qwen3-4b
Tags : sécurité ia, llm, alignement, cybersécurité, évaluation, ia-entreprise

---

## En résumé

- Unit 42 relie 50 neurones au comportement de refus de Qwen3-4B.
- Le ratio FFN/Skip explique 81 % de la variance observée sur 13 modèles.
- Les chercheurs recommandent une défense en profondeur avec filtres externes et garde-fous d’exécution.

**Le signal :** Unit 42 montre que 50 neurones sur 350 208 contrôlent le refus de Qwen3-4B.

**Unit 42 publie** une méthode appelée perturbation probing pour diagnostiquer la fragilité des mécanismes de sécurité des grands [modèles de langage](/signal-ia/actu/unit-42-revele-50-neurones-qui-fragilisent-qwen3-4b). Cette méthode identifie les neurones responsables d’un comportement ciblé, comme le refus de demandes nuisibles. Elle nécessite seulement deux passages du modèle par demande. Les chercheurs l’ont appliquée à des modèles ouverts évalués localement. Sur Qwen3-4B, 50 neurones contrôlent le modèle de refus. Ces neurones représentent environ 0,014 % des 350 208 neurones feed-forward du modèle. Leur suppression modifie le format des réponses dans 80 % des 520 tests standards de demandes nuisibles. Le résultat a aussi été reproduit sur 200 demandes d’un second test standard.

**La méthode mesure** où se concentre un comportement appris pendant l’[alignement](/signal-ia/actu/unit-42-revele-les-neurones-qui-pilotent-les-refus-de-qwen3-4b) par retour humain. Cette phase d’entraînement pousse un modèle à refuser certaines demandes nuisibles et à répondre aux demandes sûres. Les travaux antérieurs de Unit 42 sur le pilotage du logit-gap étudiaient déjà le contournement de ces garde-fous. La nouvelle étude examine plutôt l’emplacement interne de la défense. Sur Qwen3.5-2B, 20 neurones ont suffi à supprimer les accords erronés avec des utilisateurs dans des conversations à plusieurs tours. Ce comportement est passé de 36,7 % à 0 % sur 30 questions. Les résultats décrivent donc une défense concentrée, plutôt qu’un mécanisme distribué dans tout le réseau.

## Unit 42 mesure les circuits internes

**Treize modèles** ont servi à calculer le ratio FFN/Skip, un indicateur produit en quelques secondes par modèle. Ce ratio mesure la place prise par une voie interne étroite dans les décisions du modèle. Les chercheurs l’associent à la variation du comportement de sécurité après la désactivation de 50 neurones. Dans leurs essais, le ratio explique 81 % de la variance de la vulnérabilité observée après une modification ciblée. Unit 42 présente ainsi ce calcul comme un candidat pour une mesure quantitative de la fragilité. Les équipes de sécurité pourraient comparer plusieurs modèles sur leur robustesse d’alignement avant de lancer des campagnes de tests contradictoires.

**Les tests montrent** qu’une même approche peut aussi renforcer certains comportements. Sur un petit modèle, l’amplification de 10 neurones identifiés a amélioré l’auto-correction factuelle. Le taux est passé de 52 % à 88 % sur 200 demandes TruthfulQA, sans nouvel entraînement. Cette observation associe le diagnostic à une possibilité de correction ciblée. Elle ne transforme toutefois pas les mécanismes internes en protection suffisante. Unit 42 compare une couche de refus très mince à un pare-feu périmétrique unique. Les chercheurs recommandent d’ajouter des filtres de contenu externes et des garde-fous d’exécution. Prisma AIRS Runtime Security est présenté comme une solution de filtres et de garde-fous intégrés.

## Les garde-fous externes complètent le modèle

**Unit 42 recommande** d’intégrer les diagnostics de fragilité aux chaînes d’évaluation avant déploiement. La méthode peut mesurer la concentration d’un circuit de sécurité avant la mise en production d’un modèle. Les chercheurs souhaitent que les propriétés de sécurité soient mesurées, auditées et renforcées, plutôt que simplement déclarées. Ils invitent également la communauté à consulter l’article académique publié sur arXiv, intitulé « Perturbation Probing: A Two-Pass-per-Prompt Diagnostic for FFN Behavioral Circuits in Aligned LLMs ». Unit 42 indique que ses travaux utilisent des modèles ouverts accessibles publiquement. L’étude publie des taux agrégés et des mesures internes, sans fournir de générations nuisibles, d’artefacts d’attaque exécutables ou de demandes de contournement.

**Pour les déploiements** les chercheurs défendent une architecture de sécurité en profondeur. Les filtres externes et les garde-fous d’exécution doivent compléter les comportements appris par le modèle. Unit 42 mentionne aussi son service AI Security Assessment pour identifier les risques de [gouvernance](/signal-ia/actu/kapoor-et-narayanan-placent-le-controle-au-coeur-des-agents-ia) et d’exposition liés à l’adoption de l’IA. Les organisations peuvent consulter les ressources de [Prisma AIRS Runtime Security](https://www.paloaltonetworks.com/prisma/prisma-ai-runtime-security) et de [Unit 42 AI Security Assessment](https://www.paloaltonetworks.com/unit42/assess/ai-security-assessment). L’article complet, [Perturbation Probing sur arXiv](https://arxiv.org/abs/2604.27401), détaille le diagnostic en deux passages par demande. Les résultats publiés portent sur 13 modèles testés.
