当机器人不再只是「看到就做」,而是开始「想象后果」——世界模型的架构革命,正在改写具身智能的底层方程
━━━ ━━━ ━━━
一、引子:两种智能的哲学分野
传统机器人遵循一套简洁但笨拙的逻辑:感知 → 决策 → 执行。摄像头看到什么,模型就怎么做。这种流水线式的「刺激-反应」模式,在可控环境中表现尚可,但一旦遇到从未见过的新物体、新场景、新光照条件,就会暴露出根本性缺陷——它不理解物理世界的因果关系。
2026 年 6 月初,一家名为大晓机器人(ACE Robotics) 的中国公司宣布,其自研的 开悟世界模型(Kairos WorldModel) 在四大权威具身智能基准测试中同时登顶——RoboTwin 2.0、LIBERO-Plus、WorldModelBench Robot、DreamGen。这不仅是技术的突破,更标志着具身智能从 VLA(Vision-Language-Action)范式 向 世界模型范式 的范式转移,正在从理论走向实践。
本文不讨论融资、不讨论商业模式,只聚焦一个技术问题:世界模型和传统 VLA 模型,到底有什么本质区别?
━━━ ━━━ ━━━
二、传统 VLA 的架构天花板2.1 VLA 的核心逻辑
VLA(视觉-语言-动作)模型的代表包括 Google DeepMind 的 RT-2(2023)、加州伯克利主导的 Octo(2024)、以及 Google 最新的 Gemini Robotics(2025)。
它们的共同技术路线是:用大规模互联网数据(图片、文本、视频)预训练一个 Vision-Language Model(VLM),然后将机器人动作空间「离散化」为 token,与文本 token 一起在 VLM 中进行联合微调。
以 RT-2 为例:
输入: 摄像头图像 + 自然语言指令(如"把黄色杯子放到蓝色托盘上") ↓ VLM backbone(PaLM-E / PaLI-X)进行视觉-语言联合编码 ↓ 输出: 机器人动作 token(末端执行器的位置、旋转、夹爪开合)
关键创新:将动作输出编码为文本 token,使得 VLM 可以在同一个语言空间中处理\"思考\"和\"行动\"。
典型性能:RT-2 在 6000+ 次真实机器人试验中达到了 97% 的已知物体成功率、76% 的新物体泛化成功率(来源:Brohan et al., \"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control\", arXiv:2307.15818, 2023)。
2.2 VLA 的三重困境
尽管 VLA 取得了突破,其底层架构存在三个无法回避的局限性:
① 物理缺失(Physics Blindness)
VLA 本质上是模式匹配系统。它学习的是「图像 → 动作」的统计相关性,而不是物理世界的因果规律。当面对柔性物体(毛巾、面团)、流体(水、油)、或者复杂的多物体交互时,VLA 的失败率急剧上升。
② 因果匮乏(Causal Deficiency)
VLA 不建模\"如果我这样做,世界会怎样变化\"这个问题。它没有内部仿真器来预测动作的后果。用 David Ha 和 Jürgen Schmidhuber 在 \"World Models\"(2018)中的话说——这样的系统只有快思考(System 1),没有慢思考(System 2)。
③ 推理延迟(Inference Latency)
每生成一个动作 token,VLA 都需要跑一次完整的 VLM 推理。高分辨率图像输入 + 大模型计算的组合,使得 RT-2 的控制频率只有 1-3 Hz(来源:DeepMind 技术报告)。这对于需要精细力控的灵巧操作来说是致命的。
━━━ ━━━ ━━━
三、世界模型的范式突破3.1 什么是世界模型?
世界模型的核心思想来自 David Ha 和 Jürgen Schmidhuber 的开创性论文 \"World Models\"(arXiv:1803.10122, 2018),以及后续 LeCun 提出的 \"World Model\" in JEPA(Joint Embedding Predictive Architecture)。
与 VLA 的「感知→动作」直接映射不同,世界模型建立了一个 内部环境的动态表征:
输入: 当前观察 + 历史状态 ↓ 世界编码器(World Encoder): 压缩为隐含状态表征 ↓ 世界动力学(World Dynamics): 预测下一个状态的分布 ↓ 动作规划器(Action Planner): 在内部仿真中搜索最优动作序列 ↓ 输出: 动作
核心区别:世界模型先问「世界将会怎样变化」,再回答「我应该做什么」。
3.2 Kairos 的技术架构
大晓机器人的 Kairos 开悟世界模型 是这一范式的工程化实践。其架构被描述为「多模态理解——生成——预测」一体化原生统一世界模型。
技术细节标注:
- 参数规模:4B 参数(Kairos 3.0-4B),远小于其它主流方案(NVIDIA Cosmos 3.0 为 16B 参数,Google Gemini Robotics 参数未公开但推理在云端进行)
- 计算效率:参数效率提升 4 倍——意味着在同等 benchmark 性能下,参数量仅为竞品的 1/4
- 端侧部署:可在 NVIDIA Jetson Thor T5000 等端侧平台实现 1:1.5 的实时生成速度(即每秒生成 1.5 帧预测)
- 时序质量:在 DreamGen 评测中时序一致性指标满分 1.00——意味着生成的视频/预测帧之间无跳变、无鬼影
关键创新点——自定义混合线性注意力算子(Hybrid Linear Attention Operator):
传统 Transformer 的注意力机制复杂度为 O(n²),对于视频预测这种需要处理长时序序列的任务是巨大的计算瓶颈。Kairos 采用混合线性注意力来降低计算复杂度,使得 4B 模型能够在端侧运行。
训练数据:
- 十余万小时以人为中心的实景数据
- 数百万小时的互联网真实世界视频
- 覆盖数百类职业场景(家庭、工厂、仓储、医疗等)
这一数据策略的核心价值在于:通过大量人的操作数据来学习物理世界的因果关系。观察人如何倒水、如何折叠毛巾、如何抓取滑动的物体——这些数据包含丰富的物理交互信息。
3.3 四大 Benchmark 全解析
① RoboTwin 2.0:评估机器人在双机械臂协同任务中的表现,涵盖装配、搬运、操作等工业级场景。Kairos 在场景级泛化(Scene-level Generalization)维度大幅领先。
② LIBERO-Plus:FLORIDA 大学和英伟达联合提出,评估机器人在长时域任务中的规划与执行能力。Kairos 在长程推理(Long-horizon Reasoning)指标上胜出。
③ WorldModelBench Robot:由 UC Berkeley、UCSD、NVIDIA、MIT 联合提出的世界模型专项基准,评估模型对物理世界的理解程度。Kairos-4B 以 9.30 分 的总成绩位列榜首。该基准测试的维度包括:
| 维度 | 满分 | 说明 |
|---|---|---|
| 物体恒存性 | --- | 物体离开视野后是否仍被认知存在 |
| 物理规律遵循 | --- | 重力、碰撞、摩擦力等基本物理规则 |
| 时序一致性 | --- | 连续帧之间物体状态是否合理 |
| 空间推理 | --- | 物体之间的空间关系和相对位置 |
④ DreamGen:NVIDIA 于 2025 年提出的视频生成+状态预测评测。Kairos 的成绩:
| 评测维度 | Kairos 得分 | 说明 |
|---|---|---|
| 物理遵循 | 4.96/5.00 | 其中牛顿力学和重力两大核心维度均获 满分 1.00 |
| 时序质量 | 1.00/1.00 | 满分 |
| 指令遵循 | 2.36 | 与 NVIDIA Cosmos 3.0(16B 参数)并列全球第一,参数效率提升 4 倍 |
━━━ ━━━ ━━━
四、世界模型 vs VLA:逐项技术对比
| 比较维度 | VLA(RT-2/Octo/Gemini Robotics) | 世界模型(Kairos) |
|---|---|---|
| 核心哲学 | 感知→动作直接映射 | 建立内部世界表征→推理→行动 |
| 因果推理 | ❌ 无 | ✅ 显式建模物理因果 |
| 长时域规划 | ❌ 困难(动作碎片化) | ✅ 可在内部仿真中搜索长链 |
| 物理交互 | ❌ 柔性/流体操作不稳定 | ✅ 物理规律显式编码 |
| 泛化方式 | 数据驱动(Web-scale 预训练) | 规律驱动(物理模型 + 数据) |
| 控制频率 | 1-3 Hz(大模型推理瓶颈) | 1:1.5 实时(端侧部署) |
| 参数效率 | 低(SOTA 模型 16B+) | 高(4B 达到同等性能) |
| 端侧部署 | ❌ 通常需要云端 | ✅ Jetson Thor T5000 本地运行 |
| Scenario 泛化 | 中等(对手的语义泛化好,对场景泛化弱) | 强(场景级泛化大幅领先) |
这个对比表揭示了一个关键洞察:VLA 擅长「语义泛化」,世界模型擅长「物理泛化」。
- VLA 知道「杯子」是什么——因为它看过无数张杯子的图片
- 世界模型知道「杯子如果掉到地上会碎」——因为它学习了物理因果
两种泛化能力不是互斥的,而是互补的。
━━━ ━━━ ━━━
五、这条技术路线的前世今生
世界模型不是凭空出现的。它有着清晰的技术传承:
| 时间 | 里程碑 | 来源 |
|---|---|---|
| 2018 | \"World Models\" --- Ha & Schmidhuber 提出世界模型的数学框架 | arXiv:1803.10122 |
| 2020 | Dreamer 系列 --- Hafner et al. 将世界模型用于强化学习 | arXiv:1912.01603, 2020.06875 |
| 2022 | GATO --- DeepMind 通用智能体(一个模型做 600+ 任务) | arXiv:2205.06175 |
| 2023 | RT-2 --- VLA 范式的大规模验证 | arXiv:2307.15818 |
| 2024 | Octo --- 开源通用机器人策略(Open X-Embodiment) | octo-model.github.io |
| 2025.05 | DreamGen --- NVIDIA 提出世界模型评测基准;Cosmos 系列发布 | research.nvidia.com |
| 2025.12 | Kairos 架构发布 --- 首创「多模态理解---生成---预测」一体化架构 | ACE Robotics |
| 2026.03 | Kairos 3.0-4B 开源 --- 全球首款可端侧直驱的世界模型 | github.com/ACE-Robotics/Kairos |
| 2026.06 | Kairos-HomeWorld --- 全屋生成+交互的可微世界模型 | arXiv(联合香港中文大学) |
特别值得注意的是:NVIDIA 2025 年底发布的 Cosmos 3.0 与 Kairos 采用 完全相同的「多模态理解——生成——预测」一体化架构。这不仅是巧合,更说明业界对这一技术路线的共识正在形成。
━━━ ━━━ ━━━
六、LeisureLinux 的观察
世界模型 vs VLA 之争,本质上是关于一个问题:智能的本质是什么?
VLA 的答案:智能是模式匹配——在大量数据中找到从感知到行动的最优映射。
世界模型的答案:智能是心智建模——在大脑中构建外部世界的运行模拟器。
这不是「谁取代谁」的问题。更可能的发展路径是融合:
- 顶层:VLA 的语义理解能力(识别物体、理解指令、场景描述)
- 底层:世界模型的物理仿真能力(预测后果、规划动作、推理因果)
- 中间层:一种「世界感知注意力」机制,使 VLA 在做决策时能够查询世界模型的状态预测
Kairos 的 4B 参数在端侧实时运行的能力,使得这种融合架构首次具备了工程可行性。当一台人形机器人可以在本地以 1:1.5 的实时速度「想象」自己行动的后果时,它就不再是单纯的执行器,而是某种意义上的「自主体」。
未来的机器人,会在执行命令之前先问自己一句:然后呢?
━━━ ━━━ ━━━
参考文献
- Ha, D. & Schmidhuber, J. \"World Models.\" arXiv:1803.10122, 2018.
- Brohan, A. et al. \"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control.\" arXiv:2307.15818, 2023.
- Brohan, A. et al. \"RT-1: Robotics Transformer for Real-World Control at Scale.\" arXiv:2212.06817, 2022.
- Team, Octo. \"Octo: An Open-Source Generalist Robot Policy.\" octo-model.github.io, 2024.
- Gemini Robotics Team, Google DeepMind. \"Gemini Robotics: Bringing AI into the Physical World.\" blog.google, 2025.
- Hafner, D. et al. \"Dream to Control: Learning Behaviors by Latent Imagination.\" arXiv:1912.01603, 2020.
- Hafner, D. et al. \"Mastering Diverse Domains through World Models.\" arXiv:2301.04104, 2023.
- ACE Robotics. \"Kairos 3.0-4B: First Open-Source Embodied World Model for On-Device Deployment.\" github.com/ACE-Robotics/Kairos, 2026.
- NVIDIA. \"Cosmos 3.0: World Foundation Models for Physical AI.\" research.nvidia.com, 2025.
- LeCun, Y. \"A Path Towards Autonomous Machine Intelligence.\" OpenReview, 2022.
- DreamGen Benchmark Team / NVIDIA. \"DreamGen: A Benchmark for Video Generation and State Prediction in Robotics.\" 2025.
- Yang, S. et al. \"Kairos-HomeWorld: Generative World Model for Interactive Home Scenes.\" arXiv, 2026.
- Song Chan Hee et al. \"WorldModelBench: Judging Video Generative World Models via Physical-based Evaluation.\" UC Berkeley, UCSD, NVIDIA, MIT, 2025.
━━━ ━━━ ━━━
*本文仅聚焦技术分析,不构成投资建议。*
微软的武林秘籍:Project Solara,重塑AI江湖的Agent新范式
Yann LeCun 最新论文深度解析:从 AGI 幻象转向超人适应性智能(SAI)
奇点前夜:马斯克预言 2026 AGI,底层架构准备好了吗?