拆解 Mistral AI 新项目Shieldstral,看 3B 小模型如何重构 AI 安全审核范式
一款 3B 级分类器,可通过统一接口审核文本、图片以及图文混合内容。 作者丨樊天骄 编辑丨郑佳美 2026 年 8 月 4 日,法国大模型厂商 Mistral AI 正式发布 Shieldstral,一款 3B 级规则自适应多模态安全分类器,可通过统一接口审核文本、图片以及图文混合内容。与依赖固定风险标签的传统安全模型不同,Shieldstral 支持在推理阶段通过自然语言输入自定义审核规则,从而根据不同业务场景调整审核标准。它围绕三层设计重构了安全审核流程:将不同审核任务统一为 Yes/No 判断题,通过对比式训练让模型学习具体的规则匹配关系,再将文本理解、视觉理解和规则适应能力整合到同一个轻量级模型中。在多个文本和多模态安全基准上,Shieldstral 甚至取得了接近甚至超过部分参数量更大模型的结果,同时保持较低的部署门槛。因此,本文将从任务建模、训练数据构造、视觉能力扩展和模型融合
mistral 大模型