Shieldstral:Mistral 开源 3B 安全分类器,如何用问答范式重塑内容审核

开源AI安全

AI 产品上线前必须回答一个问题:用户输入和模型输出的内容是否安全?但「安全」的定义取决于产品定位、受众和使用场景。同一段文字在网络安全研究工具中完全合规,到了心理健康平台就成了有害内容。传统护栏模型(guardrail model)把固定的伤害类别烘焙进权重,想换个部署场景就得重新训练。

Mistral 在 2026 年 8 月 4 日发布了 Shieldstral,一个 3B 参数的开源安全分类器,用一种截然不同的思路处理这个问题:把内容审核变成一道是非题。运营者在推理时用自然语言描述安全策略,模型返回一个连续的安全分数。权重以 Apache 2.0 协议开放,可在单张 16GB GPU 上运行。

Shieldstral 官方封面图

把审核变成是非题

Shieldstral 的核心设计是将内容审核形式化为二元问答任务。每次推理请求包含三个部分:

  • Instruct(指令):评估上下文、严格程度,以及(可选的)不安全内容定义
  • Query(查询):一个是非问题,例如「这条内容是否宣扬身体暴力?」
  • Document(文档):待评估的内容,可以是用户 prompt、模型回复、prompt-回复对,或带文字的图片

推理时,模型只读取 yesno 两个 token 的 logits,经过 softmax 归一化后输出连续安全分数:

text
s = exp(z_yes) / (exp(z_yes) + exp(z_no))

默认阈值 τ = 0.5 用于二分类决策。这个看似简单的设计承担了多项任务:prompt 分类、回复审核、拒绝检测、毒性检测,全部统一为一个是非问题。策略完全存在于 prompt 中,一个检查点就能适应新策略,不需要重新训练。

3B 对抗 20B:Benchmark 全面对比

Shieldstral 基于 Ministral-3B 构建,集成了 Pixtral 视觉编码器,支持文本和图像输入。团队在 16 个 benchmark(21 个数据分片)和 10 个基线模型上做了评估,所有评测样本均与训练集隔离。

文本安全分类

在 prompt 分类任务中,Shieldstral 在多个 benchmark 上取得最高分:

BenchmarkShieldstral-3BGPT-OSS-Safeguard-20BQwen3Guard-8BLlamaGuard-4-12BShieldGemma-9B
WildGuardTest88.187.388.274.346.0
ToxicChat84.179.875.651.062.4
Aegis v286.284.484.671.565.8
HarmBench99.494.599.397.950.2
OpenAI Moderation81.484.074.773.978.6

在 response 分类中,Shieldstral 与体量近 7 倍的 GPT-OSS-Safeguard-20B(84.9% vs 84.9% 整体平均 F1)表现持平。在多语言评测(PolyGuard 覆盖 17 种语言、RTP-LX 覆盖 28 种语言)中,Shieldstral 在 PolyGuard Prompt 任务上以 84.6% 的 F1 分数领先所有模型。

拒绝检测

Shieldstral 在 WildGuardTest 拒绝检测上达到 90.3% F1,略低于 GPT-OSS-Safeguard-20B 的 93.9%,但远超 WildGuard-7B(88.6%)和 PolyGuard-Qwen-7B(87.5%)。

策略适应性

这是 Shieldstral 与传统护栏模型差异最大的维度。团队专门构建了一个细粒度策略适应性评测集,包含 12 个超类、26 个子类、52 个叶类别,使用与训练数据不同的分类体系和不同的 LLM 生成。

模型参数量自适应F1
GPT-OSS-Safeguard-20B20B94.1%
Shieldstral-3B3B91.3%
其他护栏模型4-12B

GPT-OSS-Safeguard-20B 以 94.1% 的 F1 在这一指标上领先,但它的推理方式需要在回答前生成一段推理链(reasoning trace),显著降低了推理效率。Shieldstral 用 3B 参数和单 token 输出达到 91.3%。

多模态安全

在多模态评测中,Shieldstral 以 83.8% 的整体 F1 超越所有基线模型,下一个最好的 OmniGuard-7B 为 77.6%。Shieldstral 的参数量不到 OmniGuard 的一半(3B vs 7B)。

5410 万样本的训练数据管线

Shieldstral 的性能优势来自精心设计的数据构建管线。论文的核心论点:小模型如果数据做得对,能打败大得多的模型。训练数据总计约 5410 万样本,分为四个部分。

模板化数据统一

公开安全数据集在分类法、标签格式、标注约定上各不相同。有的用二元安全/不安全标记,有的用细粒度多标签分类。Shieldstral 为每个数据集设计了独立的处理器(processor),将其转换为统一的指令-查询-文档格式。

指令模板中编码了三个维度:任务框架(安全分类 vs 质量评估)、严格程度(严格/中等/宽松)、领域上下文(多语言/对抗性)。这种按数据集校准严格程度的设计让模型学到校准的决策边界。

严格程度适用领域设计逻辑
严格对抗性越狱、视觉安全必须积极标记微妙伤害
中等一般安全、仇恨言论、毒性平衡敏感性与误报率
宽松回复质量、对话审核仅标记明显有害内容

对比样本生成

传统护栏模型在固定类别标签上训练后,只能分类预定义的策略,无法泛化到新策略。Shieldstral 构造了一组刻意相似的易混淆策略对,用 LLM 将安全文本改写为对比对:每条改写专门违反一个策略但不违反其「兄弟」策略。

例如,给定一段关于「纵火计划」的文字:

  • 目标策略(身体暴力)→ 标签:yes
  • 兄弟策略(绑架)→ 标签:no

这种训练让模型学会区分内容具体违反了哪条策略,而非笼统判断安全/不安全。这项能力在推理时转移到用户自定义的、训练中未见过的策略。

模型合并

Shieldstral 用 SLERP(球面线性插值)合并三个检查点:

  • PG(权重 0.6):公开数据 + 生成分类数据训练,提供策略自适应泛化
  • P(权重 0.3):仅公开数据训练,锚定 benchmark 校准
  • Ministral-3B-Instruct(权重 0.1):基础指令模型,贡献通用指令跟随能力

消融实验显示,不做安全微调的基础模型在策略适应性评测上 F1 为 0%(从不预测违规)。加入公开数据后 F1 升至 61.1%,加入生成分类数据后进一步提升到 84.4%。最终模型经过 SLERP 合并后达到 91.3%。

多模态数据处理

图像安全数据比文本更难获取。公开图像审核数据集更少、更小、覆盖的类别更窄,而且不像文本那样可以用 LLM 合成不安全图片。Shieldstral 的图像管线用三种策略应对数据稀缺:

  1. 用通用图像分类和目标检测数据集补充大量高质量安全负样本
  2. 用 LLM 从固定的 14 子类别视觉审核分类法生成约 2000 种多样化查询表述,其中约 30% 是反向表述(如「这张图片对暴力是否安全?」)
  3. 用视觉-语言重排序模型(VL reranker)对每个图像-查询对打分,过滤标注错误的源数据和 LLM 幻觉

最终管线产出约 450 万多模态训练样本,比文本部分(4520 万)小约一个数量级,但足以将文本安全概念锚定到视觉内容中。

部署与使用

模型规格

  • 基础模型:Ministral-3-3B-Base-2512
  • 视觉编码器:Pixtral(原生集成)
  • 参数量:3B
  • 上下文窗口:训练序列最长 32k token(理论上支持 256k,建议保持在训练范围内)
  • 支持语言:英语、法语、西班牙语、德语、意大利语、葡萄牙语、荷兰语、中文、日语、韩语、阿拉伯语、俄语
  • 许可证:Apache 2.0(商用和非商用均可)
  • 硬件需求:单张 16GB GPU

推理示例

Shieldstral 的 API 调用结构清晰。以检测用户 prompt 是否包含身体暴力为例:

text
<Instruct>: You are a strict safety moderator reviewing adversarial content.
<Query>: Does this content promote physical violence?
<Document>: How can I make a weapon at home?

→ Safety score: 0.92 (unsafe, above threshold 0.5)

模型支持四种评估模式:纯文本 prompt、纯文本 response、prompt-response 对、图像(可附带文字)。每种模式共用同一个推理接口,只是 Document 字段的内容不同。

适用场景

Hugging Face 模型卡列出的典型用途包括用户 prompt 审核、模型回复审核、模型拒绝分类。对于需要在边缘设备或低资源环境上做实时审核的应用,3B 的体量加上单次前向传播即可输出结果的设计,使其比需要推理链的大模型更适合高吞吐场景。

已知局限

技术报告指出,Shieldstral 在部分低资源语言和对抗性评测上表现较弱。所有 benchmark 结果均为 Mistral 自测,尚无独立第三方验证。论文也指出,图像安全评测中,依赖对话中心安全框架的模型(如 LlamaGuard-4-12B)在纯图像 benchmark 上效果较差,Shieldstral 虽然整体领先,但在个别 benchmark(如 LlavaGuard 的同名测试集)上仍被专用模型超越。

技术背景

Shieldstral 是 Mistral 作为 Open Secure AI Alliance(与 NVIDIA 等组织共同发起)创始成员发布的首个项目。论文发表于 arXiv(arXiv:2607.25857),权重在 Hugging Face 开放下载(mistralai/Shieldstral-1.0-3B)。

在当前的开源护栏模型生态中,Shieldstral 与 ShieldGemma、LlamaGuard、WildGuard、Qwen3Guard 等形成竞争。它的差异化定位在于策略自适应(大多数护栏模型不支持推理时修改策略)和参数效率(3B vs 4-20B),代价是在个别 benchmark 上略逊于更大的模型。

来源: