一个杯子从桌沿滑落,最强的视频模型能画出以假乱真的画面,但你问它下一秒杯子往哪儿弹、会不会砸到盘子,它答不上来。这 2 厘米的差距,暴露了整个 AI 行业的死穴。
━━━ ━━━ ━━━
一、引言:2 厘米的鸿沟
2026 年 6 月,加州大学圣地亚哥分校(UCSD)助理教授黄碧薇(Biwei Huang)创立的 Aether AI 完成了 2000 万美元种子轮融资,公司目标是打造\"因果世界模型\"(Causal World Models),为机器人装上\"物理智能的脑子\"。
差不多同一时间,前阿里通义千问负责人林俊旸创立的新公司以约 20 亿美元估值完成首轮融资,方向同样是\"世界模型\"与\"具身大脑\"。英伟达、Meta(Yann LeCun 的 JEPA 系列)、李飞飞的 World Labs 全部在押注同一个方向。
为什么全球顶尖 AI 实验室不约而同奔向同一个赛道?因为在物理世界中,当前最强大的 AI 模型暴露了一个令人不安的事实:桌子高了 2 厘米,最强的机器人就废了。
这不是参数不够的问题。这是范式的问题。
二、相关性与因果性:AI 的\"第克伯里\"时刻
要理解因果世界模型,首先要理解 AI 当前的根本局限。
现在几乎所有大模型——无论 GPT、Claude、Gemini,还是视频生成模型——本质上是相关性引擎。它们从海量数据中学习\"A 与 B 同时出现\"的模式。当足够多的\"杯子在桌沿\"图片都临近\"杯子坠落\"的画面,模型学会了在像素空间中预测下一个帧。
但它从没学过为什么杯子会坠落。
这个区别比看起来深得多。图灵奖得主 Judea Pearl 在其 2011 年获奖工作基础上,提出了著名的 \"因果层级\"(Ladder of Causation) 框架:
| 层级 | 能力 | 问题 | 当前 AI |
|---|---|---|---|
| 第一层:关联(Association) | 看 | 如果观察到 X,Y 会怎样? | ✅ 大模型擅长 |
| 第二层:干预(Intervention) | 做 | 如果我改变 X,Y 会怎样? | ❌ 需要因果模型 |
| 第三层:反事实(Counterfactual) | 想象 | 如果当时没做 X,Y 会怎样? | ❌ 最难的推理 |
Pearl 的洞见在于:把\"看到\"当作\"理解\",是统计学对 AI 最大的误导。当前的大语言模型和视觉模型基本停留在第一层。它们能写出流利的文章、生成逼真的图像,但面对\"如果我干预系统会发生什么\"这类问题,它们靠猜——靠记忆中相关模式的统计分布——而不是靠真实的因果关系推理。
Pearl 为此创立了完整的数学框架:结构因果模型(SCM) 和 do-算子(do-calculus)。do-算子提供了一套形式化规则,允许从观测数据中识别因果效应,回答\"如果我干预 X 会怎样\"的问题。(Pearl, 2009; Pearl & Mackenzie, 2018)
三、从世界模型到因果世界模型3.1 什么是世界模型
\"世界模型\"(World Model)这个概念最早可以追溯到 1990 年代 Schmidhuber 的工作,但真正引爆学术界是 2018 年 Ha & Schmidhuber 的论文 *World Models*。简单来说,世界模型是 AI 系统在内部对物理世界的运作方式构建的神经表征——不仅包括\"看到什么\",还包括\"接下来会发生什么\"以及\"我做什么会改变它\"。
Yann LeCun 是这一方向的另一位旗帜人物。从他的早期工作到 JEPA(Joint Embedding Predictive Architecture)系列,LeCun 一直强调:真正的智能需要学习世界运行的因果结构,而不是在像素空间做押韵游戏。
2026 年初,LeCun 从 Meta 离职创立 AMI Labs,专注将世界模型规模化落地。与此同时,LeCun 团队相继发布了 Causal-JEPA (C-JEPA) 和 LeWorldModel (LeWM) 等成果,其中 C-JEPA 通过\"对象级掩码\"机制,在反事实推理基准上取得了约 20 个百分点的绝对提升(Causal-JEPA, 2026)。
3.2 Aether AI:从相关到因果
Aether AI 是这场范式迁移的最新玩家。创始人黄碧薇(Biwei Huang)在因果发现和因果 AI 方向深耕了十多年,她在 CVPR 2026 上发表的因果世界模型研究,给出了一个比 JEPA 更明确的工程化框架。
Aether 的核心主张可以概括为:
真正的智能必须能回答三个问题:
1. 哪些变量真正驱动结果?(因果发现)
2. 干预之后未来会怎么变?(因果推理)
3. 换种做法,结果会不会不同?(反事实推理)
这三问依次对应 Pearl 因果层级的第二层和第三层。相关性引擎一个都答不上来。
Aether 的架构被设计为一个 \"四层因果大脑\":
观察 → 推断隐藏状态 → 推理干预后果 → 行动主动测试 → 更新模型 ↑ | └──────── 预期与实际差距 ──────────┘
这个闭环的核心区别在于:传统机器人是感知→控制的直接映射,中间没有\"理解\"环节。Aether 的因果世界模型在其中插入了一层\"物理直觉\"——它能在脑内模拟接触力、摩擦、约束,预测每一推、每一抓的后果,并从实际反馈中持续更新模型,而不是每次失败就从头重训。
这正是机器人走出实验室的关键一步。规模带来容量,因果结构让容量变得可靠、可迁移、可落地。
四、因果推理的技术基础
为了理解因果世界模型的技术深度,我们需要简要回顾因果推理的三大理论基础:
do-算子(do-calculus)
Pearl 在 1995 年提出的 do-算子是一套三规则的形式系统,回答\"在观测数据上能否识别因果效应\"的问题。其核心思想是:通过因果图(DAG,有向无环图),我们可以判断后门路径和前门路径,从而在没有做真实实验时推断\"如果做干预会怎样\"(Pearl, 1995; Pearl, 2009)。
结构因果模型(SCM)
SCM 将因果系统建模为一组结构方程:\$X_i = f_i(PA_i, U_i)\$,其中 \$PA_i\$ 是 \$X_i\$ 的直接因果父节点,\$U_i\$ 是外生噪声。这个框架统一了干预、反事实和因果发现三大任务(Pearl, 2009)。
因果发现(Causal Discovery)
黄碧薇团队十多年的核心工作集中在\"从观测数据中自动发现因果结构\"——即在不知道哪些变量之间的因果方向时,仅从数据推断出因果图(Huang et al., 2018; Zhang et al., 2011)。这是因果推理中最难的一环:它要求区分\"相关性\"和\"因果性\",但数据本身只展示相关性。
Aether AI 的突破之一就是将因果发现从传统的小规模结构化数据扩展到高维非结构化数据(如图像、视频),使因果结构能直接从感知数据中提取出来。
五、全球竞争版图
2025-2026 年,\"因果世界模型\"已从学术论文变成了一场资本和技术竞赛:
| 玩家 | 创始人 | 定位 | 融资/估值 |
|---|---|---|---|
| Aether AI | 黄碧薇(UCSD) | 因果世界模型,机器人\"物理大脑\" | \$20M 种子轮 |
| 林俊旸新公司 | 林俊旸(前 Qwen 负责人) | 世界模型 + 具身大脑 | \~\$20 亿估值 |
| World Labs | 李飞飞(斯坦福) | 空间智能,3D 世界模型 | 商业化产品 Marble |
| AMI Labs | Yann LeCun(前 Meta) | JEPA 世界模型规模化 | N/A(刚创立) |
| NVIDIA | --- | Physical AI 世界模型 | 内部研发 |
特别值得注意的是黄碧薇的技术路线在方法论上的差异。李飞飞的 World Labs 侧重空间智能的生成和交互——\"在 3D 世界中看和走\";LeCun 的 JEPA 侧重于学习抽象表征中的预测;而 Aether AI 把因果结构作为核心,要求模型不仅\"知道怎么走\",还要\"知道为什么\"。
这三条路线的交汇和竞争,将在未来三年定义 Physical AI 的方向。
六、挑战与展望
因果世界模型虽然方向正确,但从实验室到产业落地仍面临巨大挑战:
1. 因果发现的复杂性。 真实世界的因果图往往包含大量隐藏变量和反馈回路,从有限观测数据中识别出正确的因果结构在计算上仍是 NP-hard 问题。
2. 规模化的工程难题。 因果模型长期以来是\"小数据、小模型\"的领域。如何将因果推理扩展到数十亿参数规模、同时保持因果结构的形式可靠性,是一个未解决的技术难题。
3. 闭环系统的安全性。 当机器人依赖内部因果模型做决策时,模型误差可能被错误闭环放大。确保因果世界模型在分布外的安全性是产业应用的前置条件。
但正是这些挑战,构成了这门技术最大的吸引力。还记得 Aether AI 推文里的那句话吗?
\"规模带来容量,因果结构让容量变得可靠、可迁移、能真正落地。\"
如果说 2023-2025 是\"更大、更快、更强\"的规模竞赛,那么 2026 年开始,\"更聪明、更可靠、更懂因果\"成为了新标准。那 2 厘米的差距,今天还是 AI 的死穴;十年后再看,可能会是世界模型历史的第一块多米诺骨牌。
━━━ ━━━ ━━━
参考文献
- Pearl, J. (2009). *Causality: Models, Reasoning, and Inference* (2nd ed.). Cambridge University Press.——因果推理的奠基性著作。
- Pearl, J. & Mackenzie, D. (2018). *The Book of Why: The New Science of Cause and Effect*. Basic Books.——面向大众的因果推理科普,提出了\"因果层级\"框架。
- Pearl, J. (1995). Causal diagrams for empirical research. *Biometrika*, 82(4), 669-688.——do-算子的原始论文。
- Ha, D. & Schmidhuber, J. (2018). World Models. *arXiv:1803.10122*.——现代世界模型的奠基性工作。
- LeCun, Y. (2022). A Path Towards Autonomous Machine Intelligence. *Open Review*.——LeCun 对世界模型和 JEPA 架构的设想。
- Causal-JEPA (C-JEPA). (2026). Causal-JEPA: Joint Embedding Predictive Architecture for Object-Centric Causal World Models. *arXiv preprint*.——将因果归纳偏置引入 JEPA 的最新工作。
- LeWorldModel (LeWM). (2026). First JEPA trained end-to-end from raw pixels.——LeCun 团队 2026 年成果。
- Huang, B., Zhang, K., Gong, M., & Glymour, C. (2018). Causal Discovery from Heterogeneous/Nonstationary Data with Missing Values. *Journal of Machine Learning Research*.——黄碧薇在因果发现领域的关键工作。
- Zhang, K., Peters, J., Janzing, D., & Schölkopf, B. (2011). Kernel-based conditional independence test and application in causal discovery. *UAI 2011*.——因果发现的核心算法基础。
- Schölkopf, B. (2022). Causality for Machine Learning. *Foundations and Trends in Machine Learning*.——从因果视角重新审视机器学习基础。
- Glymour, C., Zhang, K., & Spirtes, P. (2019). Review of Causal Discovery Methods Based on Graphical Models. *Frontiers in Genetics*, 10, 524.——因果发现方法综述。
- Internally Displaced People (IDP) / Aether AI. (2026). Causal World Models for Physical Intelligence. *CVPR 2026 Workshop*.——黄碧薇团队在 CVPR 2026 发表的因果世界模型工作。
- World Labs. (2025). From Words to Worlds: Spatial Intelligence is AI\'s Next Frontier. 李飞飞关于空间智能的宣言。
- Alibaba Qwen Team. (2026). Qwen-Robot: Embodied AI Foundation Models. 阿里具身智能基础模型系列。
━━━ ━━━ ━━━
*📡 本文参考资料涵盖因果推理、世界模型、具身智能三大领域的核心文献和最新进展。*
*🤖 本文由 AI 辅助撰写,请注意交叉验证学术内容。*