L'entreprise française Mistral AI a introduit un modèle de sécurité nommé Shieldstral, conçu pour simplifier la modération des contenus générés par intelligence artificielle. Ce modèle multimodal accepte le texte et/ou les images en entrée, bien qu'il ne prenne pas en charge l'audio ou la vidéo.
Shieldstral repose sur une approche flexible de type questions-réponses, où les opérateurs formulent les directives de modération sous forme de questions fermées (« Oui/Non ») en langage naturel. Le modèle fournit un score de sécurité basé sur les probabilités des logits « Oui » et « Non », normalisés via Softmax en une valeur de sécurité continue. Il ne fournit pas de raisonnement ou de justification, mais uniquement un score.
Spécifications techniques et performance
La version Shieldstral-1.0-3B est construite sur le modèle de langage causal Ministral-3B-Base-2512 et utilise un encodeur Pixtral-Vision pour le traitement d'images. Le modèle possède environ 4 milliards de paramètres, plus précisément 3,8 milliards. Bien que sa fenêtre de contexte théorique soit de 256k, Mistral recommande de la limiter à 32k.
Score obtenu par Shieldstral, égal à celui du modèle GPT-OSS-Safeguard de 20B.
Mistral AI affirme que Shieldstral atteint les mêmes performances que des modèles sept fois plus grands. L'entreprise soutient également que Shieldstral est plus performant que ses concurrents pour un poids inférieur lors des tests de sécurité textuels et multimodaux, tout en précisant que d'autres modèles le surpassent en matière de détection de refus et d'adaptabilité aux politiques.
Shieldstral est une « public preview ».
Disponibilité et exploitation locale
Shieldstral est disponible en tant que modèle à poids ouverts sous la licence Apache-2.0 sur Hugging Face. Pour un fonctionnement local en format bfloat16, le modèle nécessite un minimum de 8 Go de mémoire, bien que Mistral recommande 16 Go. Il peut être exécuté sur un processeur graphique Nvidia de 16 Go.
Concernant son utilisation, Shieldstral ne peut traiter qu'une seule politique de modération par appel; l'application de plusieurs politiques nécessite des requêtes distinctes.