# Mistral ouvre Shieldstral pour modérer texte et images

> Mistral AI publie Shieldstral sous licence Apache 2.0, un classifieur multimodal adaptable dont les poids sont disponibles pour la modération.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-08-24 · Signal IA - Order & Chaos · Secteur : Cybersécurité
Source : https://www.orderchaos.eu/signal-ia/actu/mistral-publie-shieldstral-pour-moderer-texte-et-images
Tags : modération, mistral ai, multimodal, code ouvert, mistral, llm, inference

---

## En résumé

- Mistral AI publie les poids de Shieldstral sous licence Apache 2.0.
- Shieldstral évalue du texte et des images avec des questions fermées.
- Mistral AI fusionne plusieurs checkpoints issus de la méthode LoRA.

**Le signal :** Shieldstral combine environ 45 millions d’exemples texte et 10 millions d’exemples synthétiques ou visuels.

**Mistral AI publie** [Shieldstral](/signal-ia/actu/mistral-ai-publie-shieldstral-pour-repenser-la-moderation), son nouveau modèle de modération de contenu, le 24 août 2026. L’entreprise présente ce petit classifieur comme capable de rivaliser avec de grands modèles, à condition d’utiliser un pipeline d’entraînement adapté. Shieldstral accepte du texte, des images ou les deux. Mistral AI a publié ses poids sous licence Apache 2.0. Cette publication intervient dans le cadre de son adhésion à l’[Open Secure AI Alliance](https://blogs.nvidia.com/blog/open-secure-ai-alliance/). Le modèle dérive de Ministral-3B-Base-2512. Son approche vise une modération configurable pendant l’inférence, plutôt qu’une taxonomie figée imposée au modèle.

**Une politique adaptable** distingue Shieldstral de l’API [Mistral](/signal-ia/actu/hard-decision-layer-linference-ia-se-stabilise) Moderation, selon Mistral AI. Le modèle reçoit une question fermée portant sur le contenu à évaluer. Il peut répondre à une question comme « Ce contenu promeut-il la violence contre une minorité ? ». Il peut aussi évaluer si une image convient à une personne mineure. Chaque requête comprend trois champs : ``, `` et ``. Le premier décrit le contexte et le niveau de rigueur. Le deuxième contient la question. Le troisième contient le texte, l’image ou les deux. Shieldstral renvoie un score sans dépendre d’une taxonomie fixe.

## Mistral AI unifie les jeux d’entraînement

**Des données hétérogènes** ont nécessité une conversion spécifique pour chaque jeu d’entraînement. Mistral AI a utilisé des modèles de formulation afin d’unifier des annotations et des taxonomies différentes. Le modèle devait aussi calibrer ses décisions selon le niveau de rigueur demandé. Les instructions variaient pendant l’entraînement pour renforcer la généralisation. Mistral AI a ensuite utilisé des paires contrastives. Les exemples positifs couvraient des requêtes binaires, catégorielles et liées à des groupes cibles. Les exemples négatifs reposaient sur des catégories différentes, des groupes démographiques différents ou des contenus sûrs associés à des questions binaires portant sur des contenus indésirables.

**Les catégories restent distinctes** grâce à cette construction contrastive. Un contenu violent associé à une catégorie pouvait être confronté à des questions concernant d’autres catégories. Un contenu ciblant un groupe pouvait être associé à des questions concernant d’autres groupes. Cette méthode devait encourager l’analyse de détails sémantiques, plutôt que l’utilisation d’indices liés aux catégories. Les jeux de données de [modération](/signal-ia/actu/mistral-ai-revolutionne-la-moderation-avec-shieldstral) d’images étant rares, Mistral AI a ajouté des jeux de classification et de détection d’objets. Leurs exemples ont servi de positifs et de négatifs après permutation des requêtes par un grand modèle de langage. Les détails techniques sont présentés dans le [papier de recherche](https://arxiv.org/pdf/2607.25857).

## Shieldstral combine trois checkpoints

**La méthode LoRA** a remplacé le fine-tuning supervisé pour former Shieldstral. Mistral AI a produit deux checkpoints avant leur fusion. Le premier s’appuie uniquement sur des jeux de données publics de modération. Il représente environ 45 millions d’exemples textuels. Le second ajoute des exemples synthétiques et des images. Il représente environ 10 millions d’exemples cumulés. Mistral AI a fusionné ces deux checkpoints avec celui de Ministral-3B-Instruct. Cette dernière étape devait renforcer l’aptitude du modèle à suivre des instructions. La fiche de modèle est disponible sur [Hugging Face](https://huggingface.co/mistralai/Shieldstral-1.0-3B).
