42k Star 的 Humanizer:一份 30KB Markdown 教 AI 说人话

开源AI写作

9 月 4 日的 GitHub Trending 上,一个名为 Humanizer 的仓库以单日新增约 1200 star 的速度爬到榜单第 8 位,总 star 数 42,035。它不是模型、不是框架,只是一份 30KB 的 Markdown 文件。这份文件做的事情也很单一:把 AI 生成的文字改写得不像 AI 写的。没有代码依赖,没有 API 调用,整个项目由一名贡献者维护,MIT 协议开源。

blader/humanizer GitHub 仓库卡片:42k Stars

它到底是什么

Humanizer 的本体是一份 SKILL.md 文件,当前版本 2.11.2。这是 Agent Skills 规范定义的格式:用 Markdown 写指令,前面加一段 YAML 元数据声明名字、用途和许可协议。任何支持 skills 机制的 AI 编码助手,Claude Code、Codex、Cursor、Windsurf、Cline 等 30 多款,都能加载它。安装方式对应地也很轻:

bash
npx skills add blader/humanizer --global

装完后在对话里调用,把要改写的文本贴进去即可。它也支持指向一个文件原位改写,比如让 agent 直接处理 docs/launch-post.md

作者 Siqi Chen(GitHub ID:blader)在项目描述里写的是「Agent skill that removes signs of AI-generated writing from text」——一个去除 AI 生成文字特征的 agent 技能。仓库创建于 2026 年 1 月 18 日,最近一次推送是 8 月 19 日,发版节奏密集,仅 8 月 17 日到 18 日两天就连续发了 v2.11.0 和 v2.11.1 两个版本。

规则库的结构:35 个模式、5 个分类

Humanizer 的核心资产是一份模式清单,来源标注得很清楚:维基百科的「Signs of AI writing」指南。这份指南由 WikiProject AI Cleanup(维基百科清理 AI 生成内容的专项小组)维护,从数千条 AI 生成文本的实际案例里总结出机器写作的高频特征。Humanizer 把它整理成 35 个可检测、可改写的模式,分成五类。

内容类(Content patterns) 处理「说得比事实更 grand」的问题。模式 1 是「重要性夸大」:AI 写「标志着地区统计演进的重大时刻」(marking a pivotal moment in the evolution of regional statistics),改写后只剩「成立于 1989 年,属于西班牙行政权力下放的一部分」。模式 2 是「名人背书式罗列」:把「观点被纽约时报、BBC、金融时报和印度斯坦时报引用,社交粉丝超过 50 万」压缩成「观点被纽约时报和 BBC 引用过」。模式 5 要求「模糊归因」要么点名真实来源、要么删掉,「专家认为它起着至关重要的作用」这种句子是重灾区。

语言类(Language patterns) 处理词汇和句法。模式 7 收录 AI 高频词:actually、additionally、testament、landscape、showcasing。模式 8 叫「回避系动词」:AI 不爱写 is 和 are,偏爱 serves as、features、boasts,因为统计上这些词显得「更专业」。模式 9 针对否定平行结构(Not X but Y,中文里常见的对应形式是先否定再转折的并列句),它和句尾否定补语(clipped negative endings)同属被要求拆掉的对象。模式 12 处理「假区间」:「从大爆炸到暗物质」这类把两个遥远端点强行拉成范围的写法。

风格类(Style patterns) 里最有趣的是模式 14:破折号。em dash(—)和 en dash(–)被列为硬性清除项,替换方案是句号、逗号、冒号或括号。另有模式 15(滥用加粗)、模式 17(标题全部首字母大写的 Title Case)、模式 18(emoji)、模式 26(连字符词对,如 data-driven、cross-functional 高密度出现)。模式 31 打击「制造金句」:连续短句制造戏剧感(It had no preference. No prior. No nostalgia.),要求改成正常长短交错的句子。模式 32 处理格言式收尾(Symmetry is the language of trust),模式 33 清除「假装坦率」的开场(Honestly? It depends...)。

聊天机器人痕迹类(Chatbot patterns) 最容易理解:模式 20 清除「希望这有帮助!有其他问题随时问我」式的收尾;模式 21 清除「由于可用资料有限……」的知识截止声明;模式 22 处理「好问题!你说得完全对!」的谄媚开场。

填充与对冲类(Filler and hedging) 处理冗余:模式 23 把 in order to 换成 to、due to the fact that 换成 because;模式 24 把 could potentially possibly 这类三重对冲压成 may;模式 25 处理「未来一片光明」式的空泛收尾。

改写的边界:no-fabrication 与误伤防护

模式清单之外,这份 SKILL.md 里有两条设计约束值得单独看。

第一条是 no-fabrication rule(禁止虚构规则):改写时不得添加原文没有的事实、人名、数字、日期、引文或出处。句子如果缺一个关键细节,要么向作者要,要么用更简单的句式绕开。这条规则是 v2.9.0 加入的(对应 issue #187):早期版本的示例改写会「顺手」编造月份、地名等细节让文字显得具体,这在事实性文本里是不可接受的。当前版本里,具体性只能来自原文或作者。

第二条是误伤防护。SKILL.md 用整节列出「不该标记的东西」:语法完美不等于 AI;学术词汇不该被简化(模式 7 列的是具体的高频词,不是所有正式词);弯引号单独出现不算特征,因为 macOS、Word 和大多数 CMS 默认就会自动变弯引号;破折号单独出现也不算,很多编辑和记者正常使用它,只有和推销式节奏同时出现才作为证据;单个短句强调不算,连续多个才算。这一节的存在说明作者处理过大量误报案例——检测规则越细,误伤正常写作的概率越高,白名单是必需品。

另一个实用功能是 voice calibration(声线校准):用户可以先贴 2 到 3 段自己写的文字,技能会分析句长节奏、用词习惯和标点偏好,改写时向这个声线靠拢,而不是输出一个通用的「干净版本」。用户写作样本的优先级高于模式清单本身——如果样本里大量使用破折号,改写结果会保留破折号。

流程上还有一个双重检查机制:第一轮改写完成后,技能会做一次「是否仍明显是 AI 生成」的审计,再执行第二轮改写。这个设计在 v2.2.0 加入。

为什么是一个「反 AI」工具在 AI 工具榜上爆发

Humanizer 的走红有两个背景。

Humanizer 在 skills.sh 的收录页

第一个是检测端。维基百科设立 WikiProject AI Cleanup 的原因是大批 LLM 生成条目未经人工审核就进入词条,速删标准里专门加了 G15 条目(LLM 生成页面)。编辑社区在与 AI 文本的日常对抗中沉淀出了这份特征清单,它是一部「读者如何识别机器文字」的经验数据库。Humanizer 把防御方的知识库反转成了进攻方的修正工具。

第二个是使用端。Agent 写作渗入日常工作流之后,初稿产出成本趋近于零,但「读起来像人写的」变成了稀缺属性。 LinkedIn、公众号、小红书上的高密度 AI 味文本让读者产生了疲劳和鉴别能力,平台侧也在对模板化内容降权。文字的「人的部分」现在是编辑环节要处理的成本,Humanizer 做的就是这个编辑环节的自动化。

值得读它源文件的人会注意到一个反差:这个用来清除 AI 腔的工具,自身的 SKILL.md 在 v2.11.0 里做过一次「Plain Language 改造」,把全文改写成短句、常用词、主动语态,瘦身约 750 词。一个教授机器「怎么不像机器」的提示词,本身也要先用人工标准重写一遍。这大概解释了为什么单贡献者的 30KB 文本能持续吸引每天上千个 star:它的每一条规则都能被使用者直接验证——拿自己的文本试一次,对照 before/after,立刻知道有没有用。

安装与调用速查

bash
# 全局安装(跨项目可用)
npx skills add blader/humanizer --global

# 更新
npx skills update humanizer --global

# Claude Code 插件方式
/plugin marketplace add blader/humanizer
/plugin install humanizer@humanizer

调用形态:

text
/humanizer
[粘贴要改写的文本]

# 带声线校准
/humanizer
Here's a sample of my writing for voice matching:
[贴 2-3 段自己的文字]
Now humanize this text:
[贴 AI 文本]

# 指向文件原位改写
Humanize the prose in docs/launch-post.md

对维护内容网站的人,它更实际的用法是把模式清单当作自查表:35 条模式里大半不需要工具也能人工对照,比如检查自己的稿子里有多少否定转折式并列句、多少格言式收尾、多少以 -ing 从句缀在事实后面的浅层分析。这个清单本身已经是一份公开的「AI 腔诊断标准」。

仓库地址:https://github.com/blader/humanizer ,MIT 协议。规则来源:Wikipedia「Signs of AI writing」,由 WikiProject AI Cleanup 维护。

资料来源:blader/humanizer 仓库 README 与 SKILL.md(v2.11.2)、GitHub Releases(v2.11.0/v2.11.1)、skills.sh 收录页、GitHub Trending