「你是觉得读者看不出来,还是觉得读者不在乎?」Oxide Computer 联合创始人 Bryan Cantrill 在 9 月 5 日的博客文章《The revolt of the reader》里,把这个问题抛给了所有用大模型代笔公开文章的人。文章发布后在 Hacker News 与 Lobste.rs 两个开发者社区进入热榜。他的答案写在两组东西里:一份 668 名开发者的问卷,和一个误报率降到二万四千分之一的 AI 写作检测模型。
668 名开发者:读者如何惩罚 AI 味文章
2026 年 6 月,技术写作研究者 Cynthia Dunlop 在 X、Bluesky 和 LinkedIn 上发起问卷,收到 668 份回复,问的是一件事:当你怀疑一篇技术博客出自大模型之手,你会怎么做。
| 读者反应 | 占比 |
|---|---|
| 立刻停止阅读 | 78% |
| 以后回避这个作者 | 71% |
| 有机会就点踩 | 57% |
| 试着读完但失去兴趣 | 17% |
| 只在核心洞察可信时继续读 | 约 15% |
85% 的受访者把在意程度打到满分 5 分,11% 打 4 分。问卷里更关键的数字是 98%:这部分受访者宁愿读作者自己写的、带瑕疵的文章,也不读大模型润色过的版本。读者要的是真实感,语言完美度排在其后。
惩罚还会溢出到单篇文章之外:71% 的人表示以后会回避这个作者。Dunlop 提醒别把受访者当成自我筛选的小圈子,社交媒体上的活跃读者恰恰是最可能转发、推荐文章的人,算得上网络文字的早期采纳者和品味制造者。Cantrill 自己的阅读体感与之吻合:AI 味的结构性痕迹(比如「and here's why that framing matters!」这类过渡句)会让读者在句子中间直接退出,一种自我保护式的弃读(原文的说法是拉下「LLM 触发的弹射手柄」)。
Pangram 4:每两万四千篇只冤枉一篇
读者靠语感,机器靠检测器。Cantrill 在文章里给出了他选定的工具:Pangram。这家公司在 2026 年 7 月 29 日发布第 4 代检测模型,官方技术页给出的基准数字如下。
- 99.66% 的 AI 生成文档被正确识别
- 误报率 0.0041%,约每 24000 篇人类文章误伤 1 篇(95% 置信区间 0.0032% 到 0.0050%)
- 漏报率 0.3396%,上一代 Pangram 3 在同一数据集上是 1.99%
- 对经过轻度 AI 润色的人类文章,误判为完全 AI 生成的比例从上一代的 0.18% 降到 0.009%
误报率决定检测器能不能被机构采用。学校用它判作弊、编辑用它筛投稿,冤枉一个真人的代价远大于漏掉一篇机器文。Cantrill 的使用体验是:Pangram 3 的低误报让他敢拿它做判断,代价是漏报偏高;Pangram 4 在两个方向上同时跨了一个台阶,漏报降到接近上一代的六分之一,误报降到十四分之一。

技术上,这一代有三个关键改动。
混合专家架构。 Pangram 4 的参数量是上一代 Pangram 3.3 的 6 倍,也是该公司第一个混合专家(MoE)模型:稀疏路由机制把不同类型的输入导向网络的不同部分。官方给的理由是检测任务的输入跨度太大,从博客到论文到客服话术,单一稠密网络难以覆盖。
逐 token 三分类。 模型对输入里的每个 token(可以理解为文字碎片)给出三个分数:人写、AI 辅助、AI 生成。长文档用 512 token 的重叠窗口切分,每个窗口同时产出窗口级得分和 token 级聚合,最后平均、平滑。这套机制取代了上一版简单切块的预处理,让模型能划出 AI 内容与人类内容在同一篇文档里的边界。
训练数据与难例挖掘。 人类文本全部来自商业授权或自有语料,不使用用户提交数据、客户数据和未授权爬取内容;AI 侧用 75 个主流模型在内部生成合成样本。针对误报重灾区,团队用了 hard-negative mining:先让候选模型在储备人类语料上找出被误判的样本,生成这些样本的合成镜像,再喂回去重训。
评测规模同样可观:从 Chatbot Arena 提取真实用户 prompt,过滤掉数学和代码类请求后剩 20000 条,每条让 26 个模型各生成一次,共对 519993 个样本打分。13 个模型家族的漏报率全部低于 0.7%,最低的 Inkling 家族是 0.190%,最高的 Grok 家族是 0.605%;模型发布时间与可检测性之间没有发现显著相关性,更新的模型并没有变得更难检测。
一场 24 小时的对抗测试
人类化工具(humanizer)专门重写 AI 文本来躲避检测。Pangram 4 对 13 款商用人类化工具的识别率是 98.83%。
更有参考价值的是厂商自己组织的对抗测试:给一个名为 Codex GPT 5.6 Sol 的智能体开放 Pangram 4 API,让它攻击 24 小时,目标是造出可复现的漏检。这个智能体试了风格模仿、极简职业语体、用人类原文预填充上下文等策略,24 小时里只成功了一次,手法是模仿外科病理口述笔记。Pangram 把这次例外归为超纲:输入包含的上下文多于输出,且产出是电报式要点罗列,超出了开放性散文的检测范围。

官方示例里最有信息量的是上图这组对比。同一篇混合文档,标准答案标注 63.9% 的内容为 AI 生成:Pangram 3 的准确率只有 36.1%,精确率和召回率均为 0.0%,整篇被笼统标成人类所写;Pangram 4 的准确率 97.7%、精确率 99.8%、召回率 96.6%,逐段划出了 AI 生成的部分。人写骨架加 AI 填充再加 AI 润色的混合创作,是当下最普遍的写作形态,也是上一代检测技术实际上失效的地方。
Pangram 在技术页引用的几项研究解释了为什么混合文本骗不过新一代模型:经大模型改写的学术论文会积累模糊限定词(may、typically、suggests)和强调词(strong、robust、consistent);让作者把 AI 初稿往个人风格上改,改完的文本统计上仍更接近 AI 的写法。代笔的痕迹比想象中顽固。
垃圾邮件的旧剧本
Cantrill 用垃圾邮件的历史做类比。2000 年代初,人们担心垃圾邮件毁掉电子邮件;2000 年代末转折出现,过滤技术进步摧毁了垃圾邮件的经济学,被标记为垃圾邮件的后果变得严重,今天正规商业机构对批量邮件极其谨慎,因为域名信誉毁一次就回不来。
他的推论:AI 文章可能走同一条路。AI 文本对人类读者可识别,大规模识别在技术上已经可用(Pangram 4 的基准数字),接下来变化的是「被检测出 AI 代笔」这件事的代价。
制度层面的变化已经在发生。Oxide 把内部 RFD 576 扩展成公开写作政策:所有以 Oxide 名义发布的公开文字,必须被 Pangram 判定为人类写作。Cantrill 解释了这个标准的含义,要求的不只是「我们没有用大模型写」,还包括「读者有信心相信没有用」,而建立读者信心的方式就是让文章过检测器。他顺带点了 Rust 基金会的名,建议旗下写作团队采用同样政策。
对写字的人,边界画在哪
Cantrill 给的建议分两条线:大模型是好编辑,用它改稿没问题;让大模型代笔公开发表,读者会用退出和回避来定价。他的原话更直接:如果你觉得让模型从 prompt 生成 prose 没问题,那不如直接把 prompt 发给读者。
对中文技术写作圈,这份问卷和这个模型共同划出的现实是:读者端的惩罚行为已经被量化(78%、71%、57% 三组数字),检测端已经做到随手可用(Pangram 官网提供网页版检测器和浏览器扩展)。公开发布未声明的 AI 代笔,代价已经落到信任上。
来源: