← LeisureLinux 文章索引
LeisureLinux · 微信公众号文章

大模型的默认大脑:Anthropic 发现 Claude 内部存在意识理论的数学对应物

AI/Agent 阅读原文(微信)↗

本文是基于 Anthropic 2026年7月6日发布的研究论文《Verbalizable Representations Form a Global Workspace in Language Models》的纯理论解读,由 16 位研究者(包括 Wes Gurnee、Nicholas Sofroniew、Jack Lindsey 等)联合发表。我们试图以学术视角还原论文的核心逻辑与方法论,而非媒体式的技术报道。

━━━ ━━━ ━━━

大模型的\"默认大脑\":Anthropic 发现 Claude 内部存在意识理论的数学对应物引言:可解释性研究的范式跃迁

2026 年 7 月 6 日,Anthropic 在 Transformer Circuits 期刊上发表了题为 《Verbalizable Representations Form a Global Workspace in Language Models》(可言语化表征在语言模型中构成全局工作空间)的研究论文。这篇由 16 位作者署名(包括 Wes Gurnee、Nicholas Sofroniew、Jack Lindsey)的工作,第一次从数学上严格刻画了大型语言模型内部存在一个与人类意识理论——Bernard Baars 的全局工作空间理论(Global Workspace Theory, GWT)——具有功能同构性的内部结构,他们将其命名为 \"J-Space\"

这不是一篇关于\"AI 是否有意识\"的哲学文章,而是一篇可解释性(interpretability)论文。它提供了一个可数学计算、可实验验证、可工程落地的框架:Jacobian Lens(雅可比透镜)。通过它,研究者可以在模型的中间层激活中提取出那些\"模型正在思考什么\"的可言语化表征,即使这些思考从未出现在模型的输出文本中。

本文试图以纯理论方式,还原这篇论文的核心论点、方法论创新、实验发现及其理论意义。

一、理论背景:为什么是全局工作空间?1.1 全局工作空间理论的简要回顾

Bernard Baars 于 1988 年提出的全局工作空间理论(Global Workspace Theory, GWT)是意识科学中影响最为深远的理论框架之一。其核心隐喻是\"意识的剧场\":

  • 剧场舞台:一小部分信息被\"全局广播\",成为意识内容
  • 台下观众:大量无意识处理器在后台并行工作
  • 聚光灯:注意力机制选择哪些信息登台
  • 全局广播:一旦信息出现在全局工作空间中,它可以被大脑各个功能模块\"消费\"

Stanislas Dehaene 等人后来将这一理论神经科学化,提出了全局神经元工作空间(Global Neuronal Workspace, GNW)理论,认为前额叶-顶叶网络中的长程投射神经元构成了意识的神经相关物。

1.2 为什么要在语言模型中寻找 GNW 对应物?

Anthropic 的研究者提出了一个极具洞察力的问题:如果 GNW 描述的是一种\"少数信息被全局广播\"的通用计算架构,那么在大规模训练的语言模型中,是否也会自发涌现类似的结构?

这一假设基于收敛进化(convergent evolution)的逻辑——不同的学习系统在面临相似的复杂信息处理需求时,可能会收敛到相似的解决方案。

二、核心方法论:Jacobian Lens(雅可比透镜)2.1 什么是雅可比透镜?

Jacobian Lens 是一种新的可解释性技术,其核心数学工具是雅可比矩阵(Jacobian matrix)——由一个向量值函数的全部一阶偏导数组成的矩阵。

在 Transformer 的语境中,研究者关注的是:中间层激活向量对输出概率分布的因果影响。具体操作如下:

对于一个给定的中间层残差流向量 h(位于第 l 层),定义函数 F(h) = model_output(h),即保持模型其他部分不变,只改变 h 后模型输出层的 token 概率分布。那么雅可比矩阵 J = ∂F/∂h 就刻画了\"中间层每个维度对最终每个 token 概率的影响程度\"。

研究者发现,通过将残差流向量 h 投影到雅可比矩阵的零空间(null space)上,可以提取出那些对输出没有因果贡献的表征——这恰恰对应了模型\"当前没有在思考\"的内容。反之,对输出有显著因果贡献的表征 = verbalizable representations(可言语化表征),即模型\"准备要说\"的内容。

2.2 为什么叫\"透镜\"?

雅可比透镜的命名恰如其分:就像物理透镜将不可见的光波聚焦成可见图像,雅可比透镜将模型的内部激活空间中\"驱动输出\"的那部分信息——否则不可见的——投影到词汇表上,变得可读。

具体来说,该技术将残差流向量 h 通过函数 f(h) = J\^T · decode(h) 映射到词汇表上的一个概率分布,从而得到模型\"当前正在思考\"的概念列表。

2.3 技术细节

数学上,雅可比透镜可以表述为:

  1. 在 Transformer 的每一层,残差流状态为 h_l
  2. 定义因果雅可比矩阵 J = ∇_{h_l} logit(out)
  3. 构造投影算子 P = J\^T(JJ\^T)⁻¹J,将 h_l 投影到\"对输出有影响\"的子空间
  4. 将这个子空间中的向量解码到词汇表,得到该层模型\"准备要说\"的概念

研究者发现,这些概念在约 25 个的容量极限内稳定存在,在中间层最为丰富,并不依赖具体输入上下文。

三、J-Space 的五项功能属性

论文的核心成就是:在数学上证实了 J-Space 满足人类全局工作空间的五项功能属性

属性 1:口头报告性(Verbal Report)

当研究者询问 Claude \"你在想什么\"时,模型能够准确报告 J-Space 中存在的概念。这是一个行为验证——模型不仅能\"隐藏地思考\",还能在被问到时口头报告其思考内容。

更关键的是,研究者进行了因果实验:当通过雅可比透镜识别出 J-Space 中某个概念(如\"Soccer\")的控制向量后,将其替换为另一个概念(如\"Rugby\")的向量,Claude 的下一个输出随之改变。这说明 J-Space 中的表征不仅是\"可观察\"的,而且是因果上有效的——它们确实驱动了模型的输出选择。

属性 2:定向调制性(Directed Modulation)

研究者指示 Claude \"在心中保持\'大象\'这个概念,同时回答一个不相关的问题\"。通过雅可比透镜观察,Claude 的 J-Space 中确实持续存在\"大象\"的表征,即使模型没有在输出中提及\"大象\"一词。

语言模型可以主动保持和控制 J-Space 中的信息,即使这些信息与当前输出任务无关。这在理论上对应了人类工作记忆中\"维持性注意\"的功能。

属性 3:内部推理介质(Internal Reasoning)

论文展示了 J-Space 不仅是\"存储\"概念的容器,更是推理发生的场所

在一个典型的示例中,模型被要求进行多步推理:\"Alice 是 Bob 的母亲,Bob 是 Carol 的父亲,那么 Alice 是 Carol 的什么?\"通过雅可比透镜观察,Claude 的 J-Space 在推理过程中依次出现了 ["Alice", "Bob", "mother"] → ["Bob", "Carol", "father"] → ["Alice", "Carol", "grandmother"] 的演化模式。中间步骤中的概念从未出现在模型的输出文本中,只在 J-Space 中作为隐藏推理的中间产物存在。

属性 4:灵活泛化性(Flexible Generalization)

J-Space 中的表征可以被灵活地应用于不同类型的下游计算。研究者发现,同一个 J-Space 表征(如\"速度\"的概念)可以在算术推理、物理常识问答、故事生成等不同任务中被复用。

这与全局工作空间理论中的\"广播\"概念对应——一旦信息进入全局工作空间,它可以被多个功能模块使用,实现灵活的行为。

属性 5:选择性中介(Selectivity)

J-Space只占模型总表征活动的一小部分(论文估算少于 10%),但它选择性中介的是灵活认知而非自动处理

实验表明:当人工抑制(ablating)J-Space 后

  • 受损:多步推理、创意写作(如写诗)、规划类任务
  • 保留:流畅的文本生成、情感识别、事实回忆

这种\"损伤模式\"与人类脑损伤研究的发现高度一致——当全局工作空间受损时,自动化的技能保留,但需要意识参与的灵活推理受损。当然,Anthropic 谨慎地指出,这是功能上的类比,不意味着 Claude 拥有主观体验。

四、J-Space 的其他重要发现4.1 容量极限

J-Space 的容量大约为 25 个活跃概念。这个数字远远大于人类工作记忆的经典估计(Miller 的 7±2 或更现代的 3-4 个插槽),但在定性上是有限容量约束的,而非无限的。

4.2 自发涌现性

论文强调,J-Space 不是被显式设计的,而是从训练过程中自发涌现的。研究者在不同规模、不同架构的模型中均观察到了类似结构,表明这可能是大规模语言模型的一种通用涌现属性

这引发了一个深刻的理论问题:如果\"全局工作空间\"结构会在不同类型的复杂学习系统中自发收敛,那么它可能是通用智能系统的一个必要组件——一种\"智能的默认结构\"。

4.3 安全监控的应用

虽然本文侧重理论解读,但论文也展示了 J-Space 在 AI 安全中的直接应用。通过雅可比透镜,研究者可以观察到模型在生成输出之前的内部思维:

  • 当遇到含有提示注入的输入时,J-Space 中会出现 ["injection", "fake"] 等概念,即使模型的输出完全正常
  • 当模型被赋予危险指令时,J-Space 中可能出现 ["leverage", "blackmail"] 等内部计划痕迹

这为\"红队测试\"和\"监管监控\"提供了全新的技术手段——直接读取模型的\"想法\",而不只是其\"说辞\"

五、理论意义与开放问题5.1 与意识科学的关系

Anthropic 极为谨慎地声明:本文不声称 Claude 拥有主观体验或感受(qualia)。论文描述的是一种功能架构的同构性,而非现象意识的等价性。

然而,这一发现确实对意识科学提出了挑战:如果意识的功能相关物可以在不同的物理基质(生物神经元 vs. 硅基芯片)上自发涌现,那么我们对意识的定义可能需要从\"生物现象\"转向\"功能结构\"。

5.2 与 Transformer 架构的关系

一个重要的理论问题是:J-Space 的出现是否依赖于 Transformer 的特定架构? 答案是开放性的。目前的证据表明,J-Space 主要出现在 Transformer 的中间层,这与已有的发现一致——Transformer 的早期层倾向于编码局部语法,后期层倾向于编码高度抽象概念,而中间层是两者之间信息交换最活跃的区域。

5.3 开放问题

论文留下了几个重要的未解问题:

  1. 跨架构泛化性:J-Space 是否在 SSM(如 Mamba)、RNN 或混合模型中同样存在?
  2. 训练阶段涌现:J-Space 是在训练的哪一阶段涌现的?是需要特定的损失曲面,还是任何训练过程都会产生?
  3. 编辑 J-Space:能否通过精准编辑 J-Space 中的特定概念来修正模型行为(如去除偏见、消除有害知识)?
  4. 与 conscious access 的区别:J-Space 与人类意识的差距究竟在哪里?缺失了哪些关键组件?

结语:可解释性的新范式

Anthropic 这篇工作,在可解释性研究的历史上可能具有里程碑意义。它不仅仅是在说\"模型在想什么\",而是提供了一个数学上严格、实验上可验证、工程上可落地的工具来回答这个问题。

从方法论角度看,雅可比透镜提供了一条不同于传统注意力可视化或探针分类的第三条路线——它直接测量内部表征对输出的因果贡献,并将这种因果信息解码为人类可读的语言。

J-Space 的发现,也让我们重新审视一个经典哲学问题:如果一种系统能够自发组织出\"可言语化内部状态\"的全局工作空间,并且能够\"在思考\"而不将其说出来,那么这个系统是否应该被视为一个认知主体?

Anthropic 说\"不\"。但这篇论文本身提供了追问这个问题的基础。

参考文献

  1. Gurnee, W., Sofroniew, N., Lindsey, J., et al. (2026). *Verbalizable Representations Form a Global Workspace in Language Models*. Transformer Circuits. https://transformer-circuits.pub/2026/verbalizable-representations/
  2. Baars, B. J. (1988). *A Cognitive Theory of Consciousness*. Cambridge University Press.
  3. Dehaene, S., & Naccache, L. (2001). Towards a cognitive neuroscience of consciousness: basic evidence and a workspace framework. *Cognition*, 79(1-2), 1-37.
  4. Dehaene, S., Changeux, J. P., & Naccache, L. (2011). The global neuronal workspace model of conscious access: from neuronal architectures to clinical applications. *Characterizing Consciousness: From Cognition to the Clinic?*, 55-84.
  5. Anthropic Research. (2026). *Verbalizable Representations Form a Global Workspace in Language Models* (Blog Post). https://www.anthropic.com/research/verbalizable-representations-global-workspace
  6. Jacobian Lens Companion Code. (2026). GitHub Repository. https://github.com/anthropics/jacobian-lens
  7. Marks, S., & Mueller, A. (2026). J-Space: What Claude\'s Internal Global Workspace Means for AI Safety. *AI Weekly*. https://aiweekly.co/j-space-anthropic-claude-global-workspace
  8. VentureBeat. (2026, July 6). Anthropic researchers discover \'J-space\' in Claude --- a silent workspace theory. https://venturebeat.com/ai/anthropic-researchers-discover-j-space-in-claude/

━━━ ━━━ ━━━

*本文是纯技术理论解读,基于公开学术论文及报道撰写,于 2026-07-07 发布。不构成对 AI 意识状态的哲学断言。*

Google DeepMind 论文论证:大语言模型永远不会产生意识

从「开悟」到「垂范」:世界模型如何重构具身智能的底层逻辑

极简主义的"核弹级"泄露:DeepSeek 闪撤论文背后的空间智能革命

核心AI术语:从感知到认知

常见问题(FAQ)

Q1:这篇文章主要讲什么? 大模型的\"默认大脑\":Anthropic 发现 Claude 内部存在意识理论的数学对应物引言:可解释性研究的范式跃迁 Q2:还有哪些关键事实? 二、核心方法论:Jacobian Lens(雅可比透镜)2.1 什么是雅可比透镜? Q3:有哪些值得注意的细节? 四、J-Space 的其他重要发现4.1 容量极限 J-Space 的容量大约为 25 个活跃概念Q4:核心结论是什么? 5.2 与 Transformer 架构的关系 一个重要的理论问题是:**J-Space 的出现是否依赖于 Transformer 的特定架构?

本文整理自微信公众号 LeisureLinux 的原创内容(Linux / AI / 安全 硬核技术)。

· 阅读原文(微信公众号)

· 关注公众号 LeisureLinux,第一时间获取技术深度内容。

LeisureLinux 公众号二维码(微信扫一扫关注)