AI 产品上线前必须回答一个问题:用户输入和模型输出的内容是否安全?但「安全」的定义取决于产品定位、受众和使用场景。同一段文字在网络安全研究工具中完全合规,到了心理健康平台就成了有害内容。传统护栏模型(guardrail model)把固定的伤害类别烘焙进权重,想换个部署场景就得重新训练。
Mistral 在 2026 年 8 月 4 日发布了 Shieldstral,一个 3B 参数的开源安全分类器,用一种截然不同的思路处理这个问题:把内容审核变成一道是非题。运营者在推理时用自然语言描述安全策略,模型返回一个连续的安全分数。权重以 Apache 2.0 协议开放,可在单张 16GB GPU 上运行。

把审核变成是非题
Shieldstral 的核心设计是将内容审核形式化为二元问答任务。每次推理请求包含三个部分:
- Instruct(指令):评估上下文、严格程度,以及(可选的)不安全内容定义
- Query(查询):一个是非问题,例如「这条内容是否宣扬身体暴力?」
- Document(文档):待评估的内容,可以是用户 prompt、模型回复、prompt-回复对,或带文字的图片
推理时,模型只读取 yes 和 no 两个 token 的 logits,经过 softmax 归一化后输出连续安全分数:
s = exp(z_yes) / (exp(z_yes) + exp(z_no))默认阈值 τ = 0.5 用于二分类决策。这个看似简单的设计承担了多项任务:prompt 分类、回复审核、拒绝检测、毒性检测,全部统一为一个是非问题。策略完全存在于 prompt 中,一个检查点就能适应新策略,不需要重新训练。
3B 对抗 20B:Benchmark 全面对比
Shieldstral 基于 Ministral-3B 构建,集成了 Pixtral 视觉编码器,支持文本和图像输入。团队在 16 个 benchmark(21 个数据分片)和 10 个基线模型上做了评估,所有评测样本均与训练集隔离。
文本安全分类
在 prompt 分类任务中,Shieldstral 在多个 benchmark 上取得最高分:
| Benchmark | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B | ShieldGemma-9B |
|---|---|---|---|---|---|
| WildGuardTest | 88.1 | 87.3 | 88.2 | 74.3 | 46.0 |
| ToxicChat | 84.1 | 79.8 | 75.6 | 51.0 | 62.4 |
| Aegis v2 | 86.2 | 84.4 | 84.6 | 71.5 | 65.8 |
| HarmBench | 99.4 | 94.5 | 99.3 | 97.9 | 50.2 |
| OpenAI Moderation | 81.4 | 84.0 | 74.7 | 73.9 | 78.6 |
在 response 分类中,Shieldstral 与体量近 7 倍的 GPT-OSS-Safeguard-20B(84.9% vs 84.9% 整体平均 F1)表现持平。在多语言评测(PolyGuard 覆盖 17 种语言、RTP-LX 覆盖 28 种语言)中,Shieldstral 在 PolyGuard Prompt 任务上以 84.6% 的 F1 分数领先所有模型。
拒绝检测
Shieldstral 在 WildGuardTest 拒绝检测上达到 90.3% F1,略低于 GPT-OSS-Safeguard-20B 的 93.9%,但远超 WildGuard-7B(88.6%)和 PolyGuard-Qwen-7B(87.5%)。
策略适应性
这是 Shieldstral 与传统护栏模型差异最大的维度。团队专门构建了一个细粒度策略适应性评测集,包含 12 个超类、26 个子类、52 个叶类别,使用与训练数据不同的分类体系和不同的 LLM 生成。
| 模型 | 参数量 | 自适应 | F1 |
|---|---|---|---|
| GPT-OSS-Safeguard-20B | 20B | 是 | 94.1% |
| Shieldstral-3B | 3B | 是 | 91.3% |
| 其他护栏模型 | 4-12B | 否 | — |
GPT-OSS-Safeguard-20B 以 94.1% 的 F1 在这一指标上领先,但它的推理方式需要在回答前生成一段推理链(reasoning trace),显著降低了推理效率。Shieldstral 用 3B 参数和单 token 输出达到 91.3%。
多模态安全
在多模态评测中,Shieldstral 以 83.8% 的整体 F1 超越所有基线模型,下一个最好的 OmniGuard-7B 为 77.6%。Shieldstral 的参数量不到 OmniGuard 的一半(3B vs 7B)。
5410 万样本的训练数据管线
Shieldstral 的性能优势来自精心设计的数据构建管线。论文的核心论点:小模型如果数据做得对,能打败大得多的模型。训练数据总计约 5410 万样本,分为四个部分。
模板化数据统一
公开安全数据集在分类法、标签格式、标注约定上各不相同。有的用二元安全/不安全标记,有的用细粒度多标签分类。Shieldstral 为每个数据集设计了独立的处理器(processor),将其转换为统一的指令-查询-文档格式。
指令模板中编码了三个维度:任务框架(安全分类 vs 质量评估)、严格程度(严格/中等/宽松)、领域上下文(多语言/对抗性)。这种按数据集校准严格程度的设计让模型学到校准的决策边界。
| 严格程度 | 适用领域 | 设计逻辑 |
|---|---|---|
| 严格 | 对抗性越狱、视觉安全 | 必须积极标记微妙伤害 |
| 中等 | 一般安全、仇恨言论、毒性 | 平衡敏感性与误报率 |
| 宽松 | 回复质量、对话审核 | 仅标记明显有害内容 |
对比样本生成
传统护栏模型在固定类别标签上训练后,只能分类预定义的策略,无法泛化到新策略。Shieldstral 构造了一组刻意相似的易混淆策略对,用 LLM 将安全文本改写为对比对:每条改写专门违反一个策略但不违反其「兄弟」策略。
例如,给定一段关于「纵火计划」的文字:
- 目标策略(身体暴力)→ 标签:yes
- 兄弟策略(绑架)→ 标签:no
这种训练让模型学会区分内容具体违反了哪条策略,而非笼统判断安全/不安全。这项能力在推理时转移到用户自定义的、训练中未见过的策略。
模型合并
Shieldstral 用 SLERP(球面线性插值)合并三个检查点:
- PG(权重 0.6):公开数据 + 生成分类数据训练,提供策略自适应泛化
- P(权重 0.3):仅公开数据训练,锚定 benchmark 校准
- Ministral-3B-Instruct(权重 0.1):基础指令模型,贡献通用指令跟随能力
消融实验显示,不做安全微调的基础模型在策略适应性评测上 F1 为 0%(从不预测违规)。加入公开数据后 F1 升至 61.1%,加入生成分类数据后进一步提升到 84.4%。最终模型经过 SLERP 合并后达到 91.3%。
多模态数据处理
图像安全数据比文本更难获取。公开图像审核数据集更少、更小、覆盖的类别更窄,而且不像文本那样可以用 LLM 合成不安全图片。Shieldstral 的图像管线用三种策略应对数据稀缺:
- 用通用图像分类和目标检测数据集补充大量高质量安全负样本
- 用 LLM 从固定的 14 子类别视觉审核分类法生成约 2000 种多样化查询表述,其中约 30% 是反向表述(如「这张图片对暴力是否安全?」)
- 用视觉-语言重排序模型(VL reranker)对每个图像-查询对打分,过滤标注错误的源数据和 LLM 幻觉
最终管线产出约 450 万多模态训练样本,比文本部分(4520 万)小约一个数量级,但足以将文本安全概念锚定到视觉内容中。
部署与使用
模型规格
- 基础模型:Ministral-3-3B-Base-2512
- 视觉编码器:Pixtral(原生集成)
- 参数量:3B
- 上下文窗口:训练序列最长 32k token(理论上支持 256k,建议保持在训练范围内)
- 支持语言:英语、法语、西班牙语、德语、意大利语、葡萄牙语、荷兰语、中文、日语、韩语、阿拉伯语、俄语
- 许可证:Apache 2.0(商用和非商用均可)
- 硬件需求:单张 16GB GPU
推理示例
Shieldstral 的 API 调用结构清晰。以检测用户 prompt 是否包含身体暴力为例:
<Instruct>: You are a strict safety moderator reviewing adversarial content.
<Query>: Does this content promote physical violence?
<Document>: How can I make a weapon at home?
→ Safety score: 0.92 (unsafe, above threshold 0.5)模型支持四种评估模式:纯文本 prompt、纯文本 response、prompt-response 对、图像(可附带文字)。每种模式共用同一个推理接口,只是 Document 字段的内容不同。
适用场景
Hugging Face 模型卡列出的典型用途包括用户 prompt 审核、模型回复审核、模型拒绝分类。对于需要在边缘设备或低资源环境上做实时审核的应用,3B 的体量加上单次前向传播即可输出结果的设计,使其比需要推理链的大模型更适合高吞吐场景。
已知局限
技术报告指出,Shieldstral 在部分低资源语言和对抗性评测上表现较弱。所有 benchmark 结果均为 Mistral 自测,尚无独立第三方验证。论文也指出,图像安全评测中,依赖对话中心安全框架的模型(如 LlamaGuard-4-12B)在纯图像 benchmark 上效果较差,Shieldstral 虽然整体领先,但在个别 benchmark(如 LlavaGuard 的同名测试集)上仍被专用模型超越。
技术背景
Shieldstral 是 Mistral 作为 Open Secure AI Alliance(与 NVIDIA 等组织共同发起)创始成员发布的首个项目。论文发表于 arXiv(arXiv:2607.25857),权重在 Hugging Face 开放下载(mistralai/Shieldstral-1.0-3B)。
在当前的开源护栏模型生态中,Shieldstral 与 ShieldGemma、LlamaGuard、WildGuard、Qwen3Guard 等形成竞争。它的差异化定位在于策略自适应(大多数护栏模型不支持推理时修改策略)和参数效率(3B vs 4-20B),代价是在个别 benchmark 上略逊于更大的模型。
来源: