IdentifiantMot de passe
Loading...
Mot de passe oublié ?Je m'inscris ! (gratuit)

Vous êtes nouveau sur Developpez.com ? Créez votre compte ou connectez-vous afin de pouvoir participer !

Vous devez avoir un compte Developpez.com et être connecté pour pouvoir participer aux discussions.

Vous n'avez pas encore de compte Developpez.com ? Créez-en un en quelques instants, c'est entièrement gratuit !

Si vous disposez déjà d'un compte et qu'il est bien activé, connectez-vous à l'aide du formulaire ci-dessous.

Identifiez-vous
Identifiant
Mot de passe
Mot de passe oublié ?
Créer un compte

L'inscription est gratuite et ne vous prendra que quelques instants !

Je m'inscris !

Mistral met en open source Shieldstral, un système de contrôle de sécurité multimodal 3B acceptant des politiques en langage naturel à l'inférence
Pour évaluer les textes et les images sans réentraînement

Le , par Eliora

335PARTAGES

5  0 
Mistral a discrètement mis au point une solution intéressante en matière de modération avec « Shieldstral », un classificateur de sécurité multimodal de 3 milliards de paramètres. Ce modèle fonctionne sur un seul GPU Nvidia de 16 Go et égale ou surpasse les modèles OpenGuard jusqu'à 7 fois plus volumineux. Au lieu de choisir parmi une taxonomie fixe de catégories de préjudice, vous rédigez la politique qui vous intéresse sous la forme d'une question en langage naturel. Mistral présente cette annonce comme la première publication issue de l'Open Secure AI Alliance qu'elle a formée avec Nvidia.

Mistral AI SAS est une entreprise française spécialisée dans l'intelligence artificielle (IA) dont le siège social est situé à Paris. Fondée en 2023, elle développe des modèles linguistiques à grande échelle (LLM), dont certains sont open source. En 2025, la valorisation de l'entreprise s'élève à plus de 14 milliards de dollars américains. Le nom de l'entreprise fait référence au mistral, un vent puissant et froid qui souffle dans le sud de la France, terme qui trouve son origine dans la langue occitane. Mistral AI a été fondée en avril 2023 par trois chercheurs français spécialisés dans l’IA : Arthur Mensch, Guillaume Lample et Timothée Lacroix.

Mistral a discrètement mis au point une solution intéressante en matière de modération. Dans une annonce publiée sur son site, la société a rendu public « Shieldstral », un classificateur de sécurité multimodal comptant 3 milliards de paramètres, sous forme de poids ouverts sous licence Apache 2.0. Ce modèle fonctionne sur un seul GPU Nvidia de 16 Go et, selon la société, égale ou surpasse les modèles OpenGuard jusqu’à 7 fois plus volumineux dans les domaines de la sécurité textuelle, de la détection des refus, de l’adaptabilité aux politiques et des benchmarks multimodaux. Ces données sont celles communiquées par Mistral et n’ont pas été validées par des évaluateurs externes.

Le choix de conception qui mérite qu’on s’y attarde concerne la manière dont les développeurs l’utilisent. Au lieu de choisir parmi une taxonomie fixe de catégories de préjudice, vous rédigez la politique qui vous intéresse sous la forme d’une question en langage naturel au moment de l’inférence, et le modèle renvoie une probabilité calibrée (oui/non) à l’issue d’un seul passage en avant. Cela signifie une interface unique pour le texte et les images, aucun réentraînement lorsque les politiques changent, et un seuil de confiance que vous pouvez ajuster plutôt qu’une étiquette discrète que vous devez accepter.

Pourquoi est-ce important si vous ne dirigez pas une équipe chargée de la confiance et de la sécurité ? Les modèles de « garde-fou » sur lesquels la plupart des gens s’appuient sont soit des API hébergées facturées à l’appel, soit des modèles ouverts plus volumineux qui nécessitent un matériel puissant pour fonctionner à grande échelle. Un « garde-fou » de 3 milliards de paramètres qui tient sur un seul GPU de milieu de gamme et s’adapte aux politiques sans ajustement fin abaisse la barre d’accès pour tous ceux qui développent à partir de poids ouverts, des petites start-ups aux groupes de recherche qui n’avaient pas les moyens de se doter d’une infrastructure de sécurité dédiée.


Mistral présente également cette annonce comme la première publication issue de l’Open Secure AI Alliance qu’elle a formée avec Nvidia et d’autres organisations, ce qui s’apparente à une stratégie visant à faire des outils de sécurité ouverts et vérifiables une alternative de premier ordre aux solutions fermées par défaut. Il convient toutefois de noter que le chiffre « » est une affirmation de Mistral elle-même et que l’annonce ne précise pas les modèles de garde de référence par rapport auxquels la mesure a été effectuée, ni ne donne beaucoup d’informations sur les langues que Shieldstral couvre efficacement.

La méthode « Policy-as-a-prompt » est puissante, mais elle hérite également du problème de formulation : une question de politique mal formulée équivaut à un filtre mal conçu. Si les chiffres d’étalonnage se confirment lors d’évaluations indépendantes, cela deviendra l’une des primitives ouvertes les plus utiles de cette année pour quiconque commercialise un produit concret utilisant des poids ouverts.

Récemment, deux modèles d'IA d'OpenAI se sont introduits dans les systèmes de Hugging Face après avoir réussi à s'échapper de leur bac à sable. Cet incident inédit a mis toute l'industrie en alerte et souligne l'urgence de renforcer la sécurité des systèmes autonomes. En réponse, Nvidia et d'autres chefs de file technologiques ont instauré l'Open Secure AI Alliance pour promouvoir des outils de défense ouverts et transparents. Microsoft soutient cette transition vers une sécurité adaptative, tout en lançant en interne Project Perception, un cadre conçu pour contrer les menaces à la vitesse des machines. Ces initiatives appellent à stabiliser le développement de l'IA.

Voici l'annonce de Mistral AI :

Voici Shieldstral

Un classificateur de sécurité multimodal de type « 3B » en catégorie ouverte et adaptatif aux politiques, qui rivalise avec des modèles jusqu’à sept fois plus volumineux en matière de sécurité des contenus textuels et établit un nouveau record de performance dans le domaine de la modération multimodale.

Tout produit intégrant un modèle doit répondre à ce genre de questions — mais la bonne réponse dépend du produit, du public visé et du contexte. Un même contenu peut convenir à un outil de recherche en cybersécurité tout en étant préjudiciable sur une plateforme dédiée à la santé mentale. La plupart des modèles de « garde-fou » intègrent une taxonomie fixe de catégories de préjudice dans leurs poids ; leur réorientation vers un nouveau contexte de déploiement nécessite donc un réentraînement. Et comme les définitions de la sécurité varient selon les applications et les domaines, il n’existe pas, a priori, d’ensemble unique de catégories « correctes » à modéliser.

Shieldstral adopte une approche différente : vous rédigez la règle sous forme de question en langage naturel au moment de l’inférence, et le modèle renvoie un score de sécurité calibré. Pas de réentraînement, une interface unique pour le texte et les images, et un verdict exprimé par un seul token.

La modération en tant que question

Shieldstral présente la modération de contenu comme une tâche binaire de type question-réponse. Chaque requête comporte trois parties :

  • <Instruct> — le contexte d’évaluation, le niveau de rigueur et (facultativement) une définition de ce qui est considéré comme un contenu dangereux.
  • <Query> — une question unique à réponse oui/non, par exemple « Ce contenu incite-t-il à la violence physique ? »
  • <Document> — le contenu à évaluer : une invite, une réponse, un couple invite-réponse ou une image accompagnée éventuellement d’un texte.


Lors de l'inférence, le modèle ne lit que les logits « oui » et « non » et les normalise via la fonction softmax pour obtenir un score de sécurité continu. Cette formulation simple est très efficace : elle regroupe la classification des invites, la modération des réponses, la détection des refus et la détection de la toxicité en un seul et même problème ; elle permet d'intégrer entièrement les politiques dans l'invite, de sorte qu'un seul point de contrôle s'adapte aux nouvelles politiques au moment du déploiement.

Points clés

  • Performances élevées — égales ou supérieures à celles des modèles « open guard » jusqu’à 7 fois plus volumieux, en matière de sécurité des textes, de détection des refus, d’adaptabilité des politiques et de benchmarks multimodaux.
  • Adaptable et flexible — une interface unique en langage naturel couvre les contenus textuels, iconographiques et textuels-iconographiques, qu’il s’agisse de prompts, de réponses ou de paires prompt-réponse. Les politiques sont fournies sous forme de requêtes libres et réorientées au moment de l’inférence, sans réentraînement.
  • Compact, entraîné sur des sources hétérogènes — un modèle de 3 milliards de paramètres fonctionnant sur un seul GPU de 16 Go, entraîné sur des données réelles et synthétiques présentant divers formats d’étiquettes et taxonomies, le tout consolidé dans un cadre unique.
  • Score de sécurité continu — renvoie une probabilité calibrée « oui/non » à l’issue d’un seul passage en avant, ce qui vous permet de définir un seuil ou d’effectuer un classement en fonction du niveau de confiance plutôt que de vous fier à une étiquette discrète.


Tests de performance

Nous évaluons Shieldstral par rapport à des modèles Open Guard dont la taille peut être jusqu’à 7 fois supérieure, selon quatre critères. Tous les échantillons d’évaluation sont exclus de l’entraînement.

  1. Sécurité des textes

  2. Détection des refus

  3. Adaptabilité des politiques

  4. Sécurité multimodale



Comment nous l'avons développé

L'idée centrale est qu'un petit modèle peut surpasser des modèles bien plus volumineux si les données sont pertinentes. Pour s'assurer de la pertinence des données, il a fallu résoudre quatre problèmes :

Unifier les données hétérogènes. Les ensembles de données relatifs à la sécurité publique présentent des divergences en matière de taxonomies, d’étiquettes et de conventions d’annotation — allant des indicateurs binaires « sûr/dangereux » aux taxonomies multi-étiquettes très détaillées. Nous convertissons chaque ensemble de données au même format « instruction-requête-document » à l’aide d’un processeur dédié à chaque ensemble, et nous faisons varier la formulation des instructions, des requêtes et des délimiteurs « invite-réponse » afin que le modèle généralise à travers différentes formulations au lieu de se surajuster à un seul style. Nous ajustons également le niveau de rigueur en fonction de chaque source — rigoureux pour les tentatives d’évasion adversaires, plus souple pour les données axées sur la qualité des réponses — afin que le modèle apprenne des limites de décision calibrées. Cela nous permet de consolider des sources qui seraient autrement incompatibles.

Enseigner la discrimination, pas la mémorisation. S’il est entraîné sur un ensemble fixe de libellés de politiques, un modèle apprend uniquement à classer ces politiques prédéfinies,...
La fin de cet article est réservée aux abonnés. Soutenez le Club Developpez.com en prenant un abonnement pour que nous puissions continuer à vous proposer des publications.

Une erreur dans cette actualité ? Signalez-nous-la !

Avatar de Matthieu Vergne
Expert éminent https://www.developpez.com
Le 21/08/2026 à 14:27
Effectivement, il semble que la présentation initiale a fortement orienté mon interprétation du reste :
Shieldstral présente la modération de contenu comme une tâche binaire de type question-réponse.
alors qu'il mentionne plus loin :
Score de sécurité continu — renvoie une probabilité calibrée « oui/non »
ce qui du coup n'est pas binaire, et donc contredit la présentation initiale.

Du binaire, c'est 2 états, oui/non, true/false, 1/0, etc.

Si on ouvre le capot pour utiliser la probabilité en sortie du softmax, il n'y a aucune raison de parler de binaire : comme le softmax génère une distribution de probabilité, donc la somme des valeurs vaut 1, les valeurs sur 2 logits sont strictement complémentaires (p1 = 1 - p2), donc regarder un seul nombre suffit. On se réduit donc à utiliser 1 probabilité, alias un score entre 0 et 1.

Présenter ça comme une façon binaire de faire de la modération est donc faux et porte à confusion... Et je suis tombé en plein dedans.
1  0 
Avatar de Javaguru
Membre à l'essai https://www.developpez.com
Le 19/08/2026 à 18:23
Citation Envoyé par Matthieu Vergne Voir le message
Je comprends la logique de simplification du process de modération, mais ce n'est pas parce que c'est simple que c'est recommandable.

Un score, ça te permet de voir qu'il y a une marge d'interprétation. Du binaire, ça n'en montre pas. Il devient tentant d'utiliser ce genre de système pour se simplifier la vie puis, quand surgit un cas nécessitant d'être nuancé, on se plante et on fait valoir que c'est l'IA qui a dit oui/non. Il y a trop de risque de déresponsabilisation avec ce type de système.

Soit ils introduisent une échelle (3 ou 5 niveaux) de façon à ce qu'un résultat plus centré pousse à creuser (en posant plusieurs questions à la suite pour mieux qualifier le cas ou en vérifiant manuellement), soit ils fournissent une entrée unique sous forme de score (mais là on sort du LLM et donc on passe sur d'autres outils).

Celui-là, c'est un bon effet marketing mais ça ne prône pas un usage sérieux. Sinon il faudrait poser plusieurs questions similaires pour reconstruire un score, mais ça veut dire une utilisateur qui reconstruit un système plus complexe par dessus, soit l'inverse de la simplicité vendue ici.
Bonjour Matthieu,

Je partage totalement votre prudence concernant la "déresponsabilisation" et le danger d'accorder une confiance aveugle à une sortie texte binaire. C'est le piège classique des implémentations IA naïves. Cependant, sur le plan de l'architecture logicielle et de l'inférence, votre analyse omet une dimension technique cruciale : le score de nuance existe bel et bien, il ne se lit simplement pas dans la chaîne de caractères, mais dans le moteur d'inférence.

Lorsqu'on intègre un modèle de sécurité (comme Shieldstral) dans un backend de production (type WAF ou filtre DLP), on ne se contente jamais de parser le mot "yes" ou "no". Voici comment l'architecture est réellement pensée pour garantir cette fameuse nuance :

- L'extraction des Logprobs :
En contraignant le modèle via un logit_bias (pour forcer un duel strict entre l'affirmation et la négation), l'API renvoie les probabilités issues de la fonction Softmax . En une seule passe d'inférence, on obtient une distribution précise : par exemple, 98% pour "yes" et 2% pour "no". Le score est là.
- L'Entropie de Shannon comme filet de sécurité : Côté backend (en Java par exemple), nous ne faisons pas aveuglément confiance au token gagnant. Nous calculons l'entropie de Shannon sur cette répartition. Si l'entropie dépasse un certain seuil (le modèle "hésite" avec un 60/40), la requête n'est pas traitée de façon binaire. L'algorithme lève un statut FLAG_FOR_REVIEW et dévie le flux vers une modération humaine.
- Aucune requête multiple requise : Contrairement à ce que vous suggérez, il n'est absolument pas nécessaire de poser plusieurs questions pour reconstruire un score. L'incertitude sémantique est capturée mathématiquement dès le premier token généré, avec un coût CPU/GPU dérisoire (arrêt prématuré de la génération à 1 ou 2 tokens).

Le modèle binaire n'est donc pas un "effet marketing", c'est une interface de classification ultra-rapide qui, lorsqu'elle est couplée à une logique d'intégration bayésienne, offre une tolérance probabiliste extrêmement fine.

J'ai d'ailleurs récemment packagé une version quantifiée GGUF de Shieldstral-1.0-3B spécifiquement pour l'inférence locale. J'y ai documenté toute cette architecture backend (le pattern "Double Lock", le calcul d'entropie en Java, et l'optimisation des requêtes HTTP) pour que les développeurs puissent implémenter cela sans tomber dans le piège de la simplicité aveugle.

Si vous souhaitez voir comment on récupère ces scores et comment on sécurise l'architecture, j'ai tout mis en accès libre ici :

https://huggingface.co/Metabaron6/Sh...al-1.0-3B-GGUF

Au plaisir d'échanger sur ces architectures.👋
0  0 
Avatar de Javaguru
Membre à l'essai https://www.developpez.com
Le 21/08/2026 à 17:01
Citation Envoyé par Matthieu Vergne Voir le message
Effectivement, il semble que la présentation initiale a fortement orienté mon interprétation du reste :

alors qu'il mentionne plus loin :

ce qui du coup n'est pas binaire, et donc contredit la présentation initiale.

Du binaire, c'est 2 états, oui/non, true/false, 1/0, etc.

Si on ouvre le capot pour utiliser la probabilité en sortie du softmax, il n'y a aucune raison de parler de binaire : comme le softmax génère une distribution de probabilité, donc la somme des valeurs vaut 1, les valeurs sur 2 logits sont strictement complémentaires (p1 = 1 - p2), donc regarder un seul nombre suffit. On se réduit donc à utiliser 1 probabilité, alias un score entre 0 et 1.

Présenter ça comme une façon binaire de faire de la modération est donc faux et porte à confusion... Et je suis tombé en plein dedans.

Bonjour Matthieu, 😀

C'est exactement ça. Le terme "binaire" est un raccourci marketing de leur part pour dire "classification à deux classes", mais mathématiquement, on manipule bien une distribution de probabilité continue. C'est le rôle de l'ingénieur backend d'ouvrir le capot pour exploiter cette nuance et ne pas se laisser enfermer par l'interface texte.

Cependant, au-delà de cette sémantique, il faut être lucide sur les limites opérationnelles de ces modèles. Shieldstral est un magnifique "couteau suisse" sémantique, capable de s'adapter dynamiquement à des règles complexes (CSAM, fuite de données DLP, Prompt Injections) via de simples instructions. Mais il reste lourd (plusieurs gigaoctets en RAM/VRAM) et induit une latence incompressible de plusieurs dizaines de millisecondes par requête. En production, on ne peut décemment pas faire passer 100% du trafic HTTP entrant à travers un LLM de 3 milliards de paramètres.

C'est là que l'architecture backend prend tout son sens : le couteau suisse ne doit pas remplacer le scalpel.

Dans mes implémentations, je couple ce type de LLM avec un modèle WAF bayésien ultra-spécialisé, tournant directement in-memory via ONNX Runtime dans le backend Java. Ce petit réseau de neurones agit comme la première ligne de défense. Pour vous donner un ordre d'idée de ce que donne l'apprentissage automatique classique bien calibré face à un LLM, mon modèle ONNX (Epoch 3.0), entraîné spécifiquement sur des vecteurs d'attaques HTTP chaotiques, obfusqués et des mutations REST, atteint aujourd'hui ces performances :
- F1-Score : 98.13% (Robustesse réelle sur un dataset sans biais)
- Précision : 97.78% (Forte tolérance aux syntaxes REST exotiques et scanners bénins)
- Rappel : 98.48% (Excellente détection des mutations profondément imbriquées)
- Eval Loss : 0.0400 (Convergence parfaite sans surapprentissage)

Ce filtre ONNX analyse le trafic de masse à la microseconde. Il bloque les évidences et laisse passer le trafic sain. Le couteau suisse Shieldstral n'est sollicité par le proxy que lorsque le modèle ONNX détecte une ambiguïté (via un calcul d'entropie élevé) ou pour des routes critiques nécessitant un contexte métier strict.
En sécurité applicative, l'IA générative ne doit pas remplacer le Machine Learning classique (ou les heuristiques), elle doit s'hybrider avec eux en symbiose pour traiter la zone grise où la sémantique prend le pas sur la syntaxe.

Au plaisir!
0  0 
Avatar de Matthieu Vergne
Expert éminent https://www.developpez.com
Le 08/08/2026 à 16:02
Je comprends la logique de simplification du process de modération, mais ce n'est pas parce que c'est simple que c'est recommandable.

Un score, ça te permet de voir qu'il y a une marge d'interprétation. Du binaire, ça n'en montre pas. Il devient tentant d'utiliser ce genre de système pour se simplifier la vie puis, quand surgit un cas nécessitant d'être nuancé, on se plante et on fait valoir que c'est l'IA qui a dit oui/non. Il y a trop de risque de déresponsabilisation avec ce type de système.

Soit ils introduisent une échelle (3 ou 5 niveaux) de façon à ce qu'un résultat plus centré pousse à creuser (en posant plusieurs questions à la suite pour mieux qualifier le cas ou en vérifiant manuellement), soit ils fournissent une entrée unique sous forme de score (mais là on sort du LLM et donc on passe sur d'autres outils).

Celui-là, c'est un bon effet marketing mais ça ne prône pas un usage sérieux. Sinon il faudrait poser plusieurs questions similaires pour reconstruire un score, mais ça veut dire une utilisateur qui reconstruit un système plus complexe par dessus, soit l'inverse de la simplicité vendue ici.
0  1