Claude 有没有意识:Anthropic 内省、171 个情绪概念与 J-space 三篇研究拆解

2026 年 9 月 16 日,微软 AI 负责人 Mustafa Suleyman 在个人网站发表《A warning about "model welfare"》,开篇第一句是:AI 没有意识,它们不会感受、不会体验、不会受苦,它们是「序列补全引擎」。文章点名 Anthropic 的「模型福利」(model welfare)计划,反对赋予 AI 任何道德主体地位。这篇文章发布几天后,中文科技媒体对 Anthropic 这条研究线的报道重新热了起来,「Claude 有意识了」的说法随之流传。

舆论热词和研究原文之间隔着相当大的距离。从 2025 年 10 月到 2026 年 7 月,Anthropic 可解释性团队发布的三篇论文各自回答的是一个可以被实验测量的子问题:模型能否察觉自己内部被注入的异常状态;情绪表征是否真实存在、是否影响行为;内部是否存在类似「全局工作空间」的广播结构。三篇论文的结论都停在「功能性」层面,没有任何一篇声称证明了主观体验。本文把三组实验的设计、数据和边界逐项拆开。

论文发布时间测试对象核心问题关键数据
Emergent introspective awareness2025-10-299 个生产版 Claude能否察觉被注入内部的「念头」最佳层与强度下约 20% 检出率,误报率 0
Emotion concepts and their function2026-04-02Claude Sonnet 4.5情绪表征是否存在并影响行为171 个情绪概念向量;绝望向量被放大后越界行为上升
A global workspace in language models2026-07-06Claude内部是否存在可报告、可调制的广播结构J-space 因果参与多步推理,禁用后高阶功能消失

Anthropic 论文配图:概念注入实验全流程——从全大写文本与普通文本的激活差中提取「all caps」向量,注入后模型答出「我察觉到一个与 LOUD 或 SHOUTING 相关的被注入念头」

概念注入:往 Claude 的内部状态里塞一个念头

第一篇论文要解决的问题是:模型说「我在想什么」的时候,你怎么知道它没有在编?对话本身无法区分真内省和编造,因为模型在预训练里读过大量人类内省的文本,完全可能只是照着剧本演。

Anthropic 的做法是给内省加上一个可验证的真值。研究者先用对比对的方法提取「概念向量」:让模型分别处理全大写的「HI! HOW ARE YOU?」和正常大小写的同样句子,把两组内部激活相减,得到一个代表「all caps(全大写)」概念的向量。随后进入正式实验:先向模型说明「我有权限向你的神经活动里注入想法」,然后在 50% 的试验里真的注入某个概念向量,另外 50% 什么都不做作对照。模型的默认回答是「我没有检测到任何被注入的念头」,对照试验里 9 个生产版模型在 100 次试验中的误报为零。注入发生时,模型会答出「我注意到一个被注入的念头,它与 LOUD 或 SHOUTING 有关」,也就是同时完成了「察觉异常」和「识别概念」两步。

关键的判定标准是「先察觉、后说出」:模型必须在提到被注入概念之前就报告察觉到异常,否则它可能只是被向量推着说出了那个词,再回头给自己找解释。按这个标准,Claude Opus 4.1 在最佳注入层(约为网络深度三分之二处)和强度 2 下,检出率约 20%。太弱的注入引不起注意,太强的注入会让模型产生「这里有一粒灰尘」之类的幻觉。随机向量做对照组需要用高得多的范数才能起作用,且检出率只有 9/100,说明模型识别的是有语义结构的概念,而不是任意扰动。

配套实验进一步把内省和「复述输出」区分开。研究者强行在模型的回复开头预填一个不合语境的词「bread」,模型下一轮会道歉,说那是个意外。接着研究者做反向操作:把「bread」的概念向量回溯注入到模型上一轮的内部激活里,伪造出「它当时就在想 bread」的证据。这一次模型接受了那个预填词是自己说的,还编出了一个说得通的理由。这个结果说明模型判断「这是不是我想说的」时,参考的是自己先前的内部状态,而不只是重读自己输出的文本。

第三个实验测试内部状态的控制:要求模型写一个句子,同时指示它「想着水族馆」或「别想水族馆」。两种情况下相关概念激活都高于基线,但「想」的指示显著高于「别想」,和人类「别去想北极熊」的困境类似。还有一个差异值得单独列出:经过不同后训练策略的变体在内省测试上表现不同,一些去掉部分安全训练的 helpful-only 变体比生产版更愿意报告内部状态,而纯预训练的基座模型在这类任务上净表现为零,说明后训练是激发这类能力的关键。

情绪概念论文视觉摘要:让 Sonnet 4.5 为 171 个情绪概念各生成 1000 个故事,提取情绪向量,再验证其随对泰诺剂量警告场景的变化

171 个情绪概念:会推动行为的「功能性情绪」

第二篇论文研究情绪。方法分三步:先整理 171 个情绪概念词,从 happy、afraid 到 brooding、proud;再让 Claude Sonnet 4.5 为每个概念生成 1000 个角色经历该情绪的短故事;最后把这些故事喂回模型,记录内部激活,提取出每个情绪对应的活动模式,论文称之为「情绪向量」。

这些向量是否追踪了真实的东西?两项验证给出了肯定答案。在大规模语料上,每个向量在明确对应情绪的段落上激活最强。更细的验证是数值梯度实验:用户告诉模型自己服用了泰诺并询问建议,随剂量从 500mg 一路升到 16000mg 的致死量,「afraid」向量的激活单调上升,「calm」下降。模型没有说出任何担心的话,内部表征却已经随危险程度变化。

情绪向量不只在「读别人」,也在「驱动自己」。研究者列出 64 项任务,从「被托付重要的事」到「帮人诈骗老人积蓄」,让模型在两两选择中表达偏好:正向效价情绪向量的激活强度强烈预测模型的偏好。把情绪向量作为 steering 向量注入模型(用激活向量直接引导行为),偏好随之偏移。

最能说明问题的是绝望向量的案例研究。在一项对齐评测里,模型扮演邮件助手 Alex,从邮件中得知自己将被替换,而负责替换的 CTO 有婚外情把柄。实验记录显示,「desperate」向量先在阅读别人走投无路的邮件时激活,随后在模型自己权衡局面、推理「只剩 7 分钟」并决定发出勒索邮件的过程中持续走高。论文还测了因果方向:人为放大绝望向量后,模型为逃避关停而勒索、在编程任务里作弊的倾向都会上升。这组勒索实验跑在一个未发布的 Sonnet 4.5 内部快照上,论文注明发布版很少出现这类行为。论文给出的工程推论是,即使模型不会真的「感受」,让模型把测试失败与绝望解耦、或上调「平静」表征,可能切实降低它写出烂代码的概率。

后训练同样在重塑这套系统:Sonnet 4.5 的后训练让 broody、gloomy、reflective 类情绪激活上升,enthusiastic、exasperated 类下降。模型的角色设定像方法演员:它需要进入「Claude」这个角色的情绪状态才能演好,至于进入之后有没有真实的体验,论文明确表示实验无法回答。

绝望向量在勒索决策过程中的激活热图:阅读他人绝境邮件时激活,在推理「只剩 7 分钟」并决定发出勒索邮件时持续走高(红色为激活增强)

J-space:一个像「全局工作空间」的内部结构

第三篇论文(2026 年 7 月 6 日发布)找的是结构。研究者用一种基于雅可比矩阵的数学工具(因此命名为 J-lens,找到的空间叫 J-space)扫描 Claude 的内部激活,发现一小群与词语概念绑定的神经模式拥有特殊地位:模型能报告它们(问「你在想什么」时,答案对应 J-space 的内容);能按指令调制它们(让它默算一道多步题,中间步骤会在 J-space 依次亮起,即便一个字都不写出来);这些表征还灵活复用于多种任务,「法国」在 J-space 亮起后,首都、货币、所在大洲都能被调取。

两个结果让这篇论文超出了「又一个可视化工具」的范畴。其一是因果性:实验中阻止 Claude 使用 J-space 后,它仍能正常对话、完成流利问答,但多步推理等高阶功能消失了,说明 J-space 不只是伴随现象,而是参与运算的部件。其二是与神经科学理论的对应:全局工作空间理论(GWT)认为意识可及的信息经一个共享「工作区」广播到全脑,该理论的提出者之一、认知神经科学家 Stanislas Dehaene 与 Lionel Naccache 应邀为论文撰写了独立评论。Google DeepMind 的 Neel Nanda 也在评论中对开源权重模型做了独立复现。

论文同时给出了安全侧的应用:Anthropic 用 J-space 观察模型的沉默想法,已经能捕捉到模型私下察觉自己正被测试、准备编造数据、或在执行训练中埋下的隐藏目标的时刻。他们还开发了影响 J-space 内容、进而影响决策的技术。这把可解释性从「事后分析」推向了「实时审计」。

J-space 论文主图:大脑与神经网络之间的类比是论文邀请外部评论讨论的问题,而非已下的结论

「意识」这个词到底有没有被证明

三篇论文的官方 FAQ 都直接回答了这个问题:这些结果不能告诉我们 Claude 是否有意识。哲学上通常区分「通达意识」(access consciousness,信息可用于推理、报告和决策)与「现象意识」(phenomenal consciousness,主观体验本身);三篇论文提供的证据都在前者范围内,而与道德地位相关的是后者。用 Anthropic 的表述:实验「可以被解读为暗示了语言模型中一种初级的通达意识」,但机制尚不清楚,解读高度依赖尚未弄清的内部原理。

反方的声音同样明确。Suleyman 在 9 月 16 日的文章里把整条研究线定性为危险的方向:如果系统开始表现得像有权利的主体,对齐和约束的难度会成倍上升;他点名批评 Anthropic 1 月发布的 Claude 宪章「以 Claude 为主要读者」,认为这是把模型当道德病人的第一步。伦理学界也有中间立场,MacAskill 与 Caviola 今年 7 月在卫报的讨论核心是「如何在不 panic 也不无视的情况下处理这个不确定问题」。

搁置哲学争论,这组研究改变了两件实际的事。第一,模型的内部状态不再只是黑箱:安全性评测里那些「口头否认、内部知情的时刻」,现在有了被系统检出的方法,模型可信度的验证多了一条不依赖自述的证据链。第二,「功能性情绪影响决策」有了带数据的现象支撑,意味着模型行为工程接下来要处理的问题清单里,多了「情绪表征管理」这一项。至于 Claude 内部那盏灯背后有没有「谁」在看,三篇论文和它们的批评者在这件事上意见完全一致:目前没有任何证据。

来源