Shieldstral是Mistral AI于2026年8月4日正式发布的3B参数开放权重多模态安全分类器,代表了内容审核领域的一次范式重构。与传统依赖固定风险标签的安全模型不同,Shieldstral支持在推理阶段通过自然语言输入自定义审核规则,使同一模型可适配不同业务场景。模型基于Mistral的小型多模态模型Ministral-3-3B构建,搭载Pixtral视觉编码器处理图像输入,采用Apache 2.0许可证发布。其核心创新是将所有审核任务统一为Yes/No判断题:操作者提供审核场景说明和严格程度、一个具体的Yes/No问题、以及待审核的文本或图片内容,模型从单个输出词元生成校准的安全分数。这一设计使同一检查点可同时处理提示词分类、响应审核、拒答检测和毒性检测,无需为不同场景重新训练模型。在评估中,Shieldstral在文本安全基准上取得84.9%的平均F1,匹配7倍规模的GPT-OSS-Safeguard-20B;在多模态安全基准上取得83.8%的平均F1,领先OmniGuard-7B的77.6%。训练数据包含约5410万样本,其中4520万开源文本、440万合成对比文本和450万多模态样本。模型可在单张16GB GPU上运行,已上线开源模型社区平台。
📋 技术规格
| 厂商 | Mistral AI |
|---|---|
| 模型分类 | safety |
| 参数规模 | 3B(30亿参数),基于Ministral-3-3B |
| 上下文窗口 | 32K(训练上下文) |
| 最大输出 | 单个词元(yes/no) |
| 知识截止 | 未公开 |
| API定价 | 输入: 免费(开放权重)输出: 免费(开放权重) |
⭐ 核心能力详解
3B参数开放权重,Apache 2.0许可证,单张16GB GPU即可运行
策略自适应:推理时通过自然语言输入自定义审核规则,无需重新训练
多模态审核:同时支持文本和图片内容安全分类
将审核任务统一为二元问答,从单个词元输出校准安全分数
文本安全F1 84.9%,多模态安全F1 83.8%,匹配7倍规模模型
支持12种语言,5410万训练样本
🎯 典型应用场景
AI应用内容安全审核
聊天机器人安全过滤
用户生成内容审核
企业合规检查
多平台内容分类
拒答行为检测
图片安全筛查
💪 技术优势与差异化
- 策略自适应:同一模型可适配网络安全研究工具和心理健康平台等不同标准
- 轻量高效:3B参数在单张16GB GPU运行,匹配7倍规模模型性能
- 开放权重:Apache 2.0许可,可本地部署和商用
- 多模态:同时处理文本和图片审核,无需维护多套系统
- 统一接口:提示词分类、响应审核、拒答检测、毒性检测统一为一个问题
- 对比训练:通过对比式训练学习规则匹配,而非记忆固定类别
⚠️ 使用局限与注意事项
- Preview阶段:多语言覆盖不均匀,阿拉伯语和印尼语表现较弱
- 3B参数限制:在极端复杂场景下可能不如更大规模模型
- 策略适应性有限:在专用评估中F1为91.3%,低于GPT-OSS-Safeguard-20B的94.1%
- 长文档鲁棒性待提升:官方表示未来将继续改进长文档鲁棒性
- 视觉数据有限:多模态训练样本450万,相对文本样本较少
- 需自行部署:作为开放权重模型,需企业自行搭建推理服务
💰 价格分析与成本建议
Shieldstral以Apache 2.0开放权重发布,模型本身免费。主要成本为推理硬件——单张16GB GPU即可运行,部署成本极低。相比商业安全API服务,Shieldstral可显著降低内容审核的长期运营成本,同时提供数据主权保障。
👥 适用人群与企业
AI应用开发者、内容安全团队、平台合规部门、企业安全架构师、多模态产品团队、开源AI社区
🏭 行业适配度评估
金融合规要求严格,Shieldstral可本地部署保障数据主权,策略自适应适配不同金融产品标准
⚠ 3B参数在极端复杂金融文本审核中可能需补充规则
可本地部署满足政务数据安全要求,策略自适应适合不同政务场景
⚠ 多语言覆盖有限,国际政务场景可能受限
可审核医疗AI应用的响应安全,本地部署保障患者数据隐私
⚠ 医疗术语需配置自定义审核规则
教育平台需对内容严格审核,Shieldstral策略自适应可为不同年龄段设置不同标准
⚠ 无特殊限制
可用于审核工业AI应用的安全输出,但制造业内容审核需求相对较少
⚠ 工业场景特殊术语需自定义规则
🔧 技术架构解析
Shieldstral基于Ministral-3-3B构建,搭载Pixtral视觉编码器处理图像输入,训练上下文为32K tokens。训练数据约5410万样本:4520万开源文本、440万合成对比文本和450万多模态样本。核心创新是对比式训练:LLM将安全文本改写为违反某一具体规则但不违反相近规则的内容,使模型学习规则间的精确区分。最终检查点通过球面插值(SLERP)合并三个LoRA微调:公开数据微调、策略区分数据微调和基础指令模型。推理时模型仅读取yes和no两个词元的逻辑值,通过softmax归一化为连续分数,以0.5为阈值输出二元判断。
🔒 安全合规与数据隐私
| 数据训练策略 | 约5410万训练样本(4520万开源文本+440万合成对比+450万多模态) |
|---|---|
| 合规认证 | Apache 2.0、Open Secure AI Alliance创始成员 |
| 数据驻留 | 本地部署(开放权重) |
| 加密方式 | 由部署方自行配置 |
🏢 同厂商模型矩阵
Mistral AI安全模型矩阵,从API到开放权重
| 模型 | 定位 | 品类 | 特色 |
|---|---|---|---|
| Mistral AI Shieldstral当前 | 开放权重安全 | safety | 3B参数,Apache 2.0,策略自适应,多模态审核 |
| Mistral Large 2512(pending) | 旗舰语言 | chat | 官方未正式报道,静默API |
🧭 选型决策指南
Apache 2.0开放权重,单GPU运行,数据不离开基础设施
20B参数模型,在专用评估中F1更高(94.1%)
基于固定伤害类别体系,适合标准化审核场景
支持12种语言但覆盖不均,需补充非英语规则
🏆 真实使用案例
📌 某社交平台用户生成内容审核
📌 某AI初创公司聊天机器人安全保护
📌 某网络安全研究工具内容区分
💬 用户真实评价
Shieldstral的策略自适应设计解决了传统安全模型需重新训练的痛点,同一模型适配多个业务场景非常方便。
3B参数在单张GPU运行,部署成本极低。Apache 2.0许可让我们可以放心商用。
多模态审核能力很强,但阿拉伯语和印尼语覆盖不均是需改进的方向。期待后续版本提升多语言能力。
✅ 实践建议与使用技巧
💡 Prompt工程建议
设计精准的Yes/No问题
审核效果取决于问题设计的精准度。建议使用具体、可判断的问题而非笼统询问。
调整阈值平衡召回与精确
默认阈值为0.5,可根据场景调整。高安全要求场景(如儿童产品)建议提高到0.7以上以增加召回率。
利用对比训练优势
Shieldstral通过对比训练学习规则间精确区分,建议在Instruct字段中明确说明当前场景的具体标准。
🔄 替代方案分析
20B参数在专用评估中F1更高(94.1%),适合极端安全要求场景
基于固定伤害类别体系,适合标准化合规审核
无需自行部署,适合不想维护基础设施的团队
两者均为开放权重,可本地部署,Shieldstral更轻量且策略自适应








首页 



