← LeisureLinux 文章索引
LeisureLinux · 微信公众号文章

从「开悟」到「垂范」:世界模型如何重构具身智能的底层逻辑

AI/Agent 阅读原文(微信)↗

当机器人不再只是「看到就做」,而是开始「想象后果」——世界模型的架构革命,正在改写具身智能的底层方程

━━━ ━━━ ━━━

一、引子:两种智能的哲学分野

传统机器人遵循一套简洁但笨拙的逻辑:感知 → 决策 → 执行。摄像头看到什么,模型就怎么做。这种流水线式的「刺激-反应」模式,在可控环境中表现尚可,但一旦遇到从未见过的新物体、新场景、新光照条件,就会暴露出根本性缺陷——它不理解物理世界的因果关系。

2026 年 6 月初,一家名为大晓机器人(ACE Robotics) 的中国公司宣布,其自研的 开悟世界模型(Kairos WorldModel) 在四大权威具身智能基准测试中同时登顶——RoboTwin 2.0、LIBERO-Plus、WorldModelBench Robot、DreamGen。这不仅是技术的突破,更标志着具身智能从 VLA(Vision-Language-Action)范式世界模型范式 的范式转移,正在从理论走向实践。

本文不讨论融资、不讨论商业模式,只聚焦一个技术问题:世界模型和传统 VLA 模型,到底有什么本质区别?

━━━ ━━━ ━━━

二、传统 VLA 的架构天花板2.1 VLA 的核心逻辑

VLA(视觉-语言-动作)模型的代表包括 Google DeepMind 的 RT-2(2023)、加州伯克利主导的 Octo(2024)、以及 Google 最新的 Gemini Robotics(2025)。

它们的共同技术路线是:用大规模互联网数据(图片、文本、视频)预训练一个 Vision-Language Model(VLM),然后将机器人动作空间「离散化」为 token,与文本 token 一起在 VLM 中进行联合微调。

RT-2 为例:

输入: 摄像头图像 + 自然语言指令(如"把黄色杯子放到蓝色托盘上") ↓ VLM backbone(PaLM-E / PaLI-X)进行视觉-语言联合编码 ↓ 输出: 机器人动作 token(末端执行器的位置、旋转、夹爪开合)

关键创新:将动作输出编码为文本 token,使得 VLM 可以在同一个语言空间中处理\"思考\"和\"行动\"。

典型性能:RT-2 在 6000+ 次真实机器人试验中达到了 97% 的已知物体成功率、76% 的新物体泛化成功率(来源:Brohan et al., \"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control\", arXiv:2307.15818, 2023)。

2.2 VLA 的三重困境

尽管 VLA 取得了突破,其底层架构存在三个无法回避的局限性:

① 物理缺失(Physics Blindness)

VLA 本质上是模式匹配系统。它学习的是「图像 → 动作」的统计相关性,而不是物理世界的因果规律。当面对柔性物体(毛巾、面团)、流体(水、油)、或者复杂的多物体交互时,VLA 的失败率急剧上升。

② 因果匮乏(Causal Deficiency)

VLA 不建模\"如果我这样做,世界会怎样变化\"这个问题。它没有内部仿真器来预测动作的后果。用 David Ha 和 Jürgen Schmidhuber 在 \"World Models\"(2018)中的话说——这样的系统只有快思考(System 1),没有慢思考(System 2)。

③ 推理延迟(Inference Latency)

每生成一个动作 token,VLA 都需要跑一次完整的 VLM 推理。高分辨率图像输入 + 大模型计算的组合,使得 RT-2 的控制频率只有 1-3 Hz(来源:DeepMind 技术报告)。这对于需要精细力控的灵巧操作来说是致命的。

━━━ ━━━ ━━━

三、世界模型的范式突破3.1 什么是世界模型?

世界模型的核心思想来自 David Ha 和 Jürgen Schmidhuber 的开创性论文 \"World Models\"(arXiv:1803.10122, 2018),以及后续 LeCun 提出的 \"World Model\" in JEPA(Joint Embedding Predictive Architecture)

与 VLA 的「感知→动作」直接映射不同,世界模型建立了一个 内部环境的动态表征

输入: 当前观察 + 历史状态 ↓ 世界编码器(World Encoder): 压缩为隐含状态表征 ↓ 世界动力学(World Dynamics): 预测下一个状态的分布 ↓ 动作规划器(Action Planner): 在内部仿真中搜索最优动作序列 ↓ 输出: 动作

核心区别:世界模型先问「世界将会怎样变化」,再回答「我应该做什么」。

3.2 Kairos 的技术架构

大晓机器人的 Kairos 开悟世界模型 是这一范式的工程化实践。其架构被描述为「多模态理解——生成——预测」一体化原生统一世界模型。

技术细节标注

  • 参数规模:4B 参数(Kairos 3.0-4B),远小于其它主流方案(NVIDIA Cosmos 3.0 为 16B 参数,Google Gemini Robotics 参数未公开但推理在云端进行)
  • 计算效率:参数效率提升 4 倍——意味着在同等 benchmark 性能下,参数量仅为竞品的 1/4
  • 端侧部署:可在 NVIDIA Jetson Thor T5000 等端侧平台实现 1:1.5 的实时生成速度(即每秒生成 1.5 帧预测)
  • 时序质量:在 DreamGen 评测中时序一致性指标满分 1.00——意味着生成的视频/预测帧之间无跳变、无鬼影

关键创新点——自定义混合线性注意力算子(Hybrid Linear Attention Operator)

传统 Transformer 的注意力机制复杂度为 O(n²),对于视频预测这种需要处理长时序序列的任务是巨大的计算瓶颈。Kairos 采用混合线性注意力来降低计算复杂度,使得 4B 模型能够在端侧运行。

训练数据

  • 十余万小时以人为中心的实景数据
  • 数百万小时的互联网真实世界视频
  • 覆盖数百类职业场景(家庭、工厂、仓储、医疗等)

这一数据策略的核心价值在于:通过大量人的操作数据来学习物理世界的因果关系。观察人如何倒水、如何折叠毛巾、如何抓取滑动的物体——这些数据包含丰富的物理交互信息。

3.3 四大 Benchmark 全解析

① RoboTwin 2.0:评估机器人在双机械臂协同任务中的表现,涵盖装配、搬运、操作等工业级场景。Kairos 在场景级泛化(Scene-level Generalization)维度大幅领先。

② LIBERO-Plus:FLORIDA 大学和英伟达联合提出,评估机器人在长时域任务中的规划与执行能力。Kairos 在长程推理(Long-horizon Reasoning)指标上胜出。

③ WorldModelBench Robot:由 UC Berkeley、UCSD、NVIDIA、MIT 联合提出的世界模型专项基准,评估模型对物理世界的理解程度。Kairos-4B 以 9.30 分 的总成绩位列榜首。该基准测试的维度包括:

维度 满分 说明
物体恒存性 --- 物体离开视野后是否仍被认知存在
物理规律遵循 --- 重力、碰撞、摩擦力等基本物理规则
时序一致性 --- 连续帧之间物体状态是否合理
空间推理 --- 物体之间的空间关系和相对位置

④ DreamGen:NVIDIA 于 2025 年提出的视频生成+状态预测评测。Kairos 的成绩:

评测维度 Kairos 得分 说明
物理遵循 4.96/5.00 其中牛顿力学和重力两大核心维度均获 满分 1.00
时序质量 1.00/1.00 满分
指令遵循 2.36 与 NVIDIA Cosmos 3.0(16B 参数)并列全球第一,参数效率提升 4 倍

━━━ ━━━ ━━━

四、世界模型 vs VLA:逐项技术对比

比较维度 VLA(RT-2/Octo/Gemini Robotics) 世界模型(Kairos)
核心哲学 感知→动作直接映射 建立内部世界表征→推理→行动
因果推理 ❌ 无 ✅ 显式建模物理因果
长时域规划 ❌ 困难(动作碎片化) ✅ 可在内部仿真中搜索长链
物理交互 ❌ 柔性/流体操作不稳定 ✅ 物理规律显式编码
泛化方式 数据驱动(Web-scale 预训练) 规律驱动(物理模型 + 数据)
控制频率 1-3 Hz(大模型推理瓶颈) 1:1.5 实时(端侧部署)
参数效率 低(SOTA 模型 16B+) 高(4B 达到同等性能)
端侧部署 ❌ 通常需要云端 ✅ Jetson Thor T5000 本地运行
Scenario 泛化 中等(对手的语义泛化好,对场景泛化弱) 强(场景级泛化大幅领先)

这个对比表揭示了一个关键洞察:VLA 擅长「语义泛化」,世界模型擅长「物理泛化」

  • VLA 知道「杯子」是什么——因为它看过无数张杯子的图片
  • 世界模型知道「杯子如果掉到地上会碎」——因为它学习了物理因果

两种泛化能力不是互斥的,而是互补的。

━━━ ━━━ ━━━

五、这条技术路线的前世今生

世界模型不是凭空出现的。它有着清晰的技术传承:

时间 里程碑 来源
2018 \"World Models\" --- Ha & Schmidhuber 提出世界模型的数学框架 arXiv:1803.10122
2020 Dreamer 系列 --- Hafner et al. 将世界模型用于强化学习 arXiv:1912.01603, 2020.06875
2022 GATO --- DeepMind 通用智能体(一个模型做 600+ 任务) arXiv:2205.06175
2023 RT-2 --- VLA 范式的大规模验证 arXiv:2307.15818
2024 Octo --- 开源通用机器人策略(Open X-Embodiment) octo-model.github.io
2025.05 DreamGen --- NVIDIA 提出世界模型评测基准;Cosmos 系列发布 research.nvidia.com
2025.12 Kairos 架构发布 --- 首创「多模态理解---生成---预测」一体化架构 ACE Robotics
2026.03 Kairos 3.0-4B 开源 --- 全球首款可端侧直驱的世界模型 github.com/ACE-Robotics/Kairos
2026.06 Kairos-HomeWorld --- 全屋生成+交互的可微世界模型 arXiv(联合香港中文大学)

特别值得注意的是:NVIDIA 2025 年底发布的 Cosmos 3.0 与 Kairos 采用 完全相同的「多模态理解——生成——预测」一体化架构。这不仅是巧合,更说明业界对这一技术路线的共识正在形成。

━━━ ━━━ ━━━

六、LeisureLinux 的观察

世界模型 vs VLA 之争,本质上是关于一个问题:智能的本质是什么?

VLA 的答案:智能是模式匹配——在大量数据中找到从感知到行动的最优映射。

世界模型的答案:智能是心智建模——在大脑中构建外部世界的运行模拟器。

这不是「谁取代谁」的问题。更可能的发展路径是融合

  • 顶层:VLA 的语义理解能力(识别物体、理解指令、场景描述)
  • 底层:世界模型的物理仿真能力(预测后果、规划动作、推理因果)
  • 中间层:一种「世界感知注意力」机制,使 VLA 在做决策时能够查询世界模型的状态预测

Kairos 的 4B 参数在端侧实时运行的能力,使得这种融合架构首次具备了工程可行性。当一台人形机器人可以在本地以 1:1.5 的实时速度「想象」自己行动的后果时,它就不再是单纯的执行器,而是某种意义上的「自主体」。

未来的机器人,会在执行命令之前先问自己一句:然后呢?

━━━ ━━━ ━━━

参考文献

  1. Ha, D. & Schmidhuber, J. \"World Models.\" arXiv:1803.10122, 2018.
  2. Brohan, A. et al. \"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control.\" arXiv:2307.15818, 2023.
  3. Brohan, A. et al. \"RT-1: Robotics Transformer for Real-World Control at Scale.\" arXiv:2212.06817, 2022.
  4. Team, Octo. \"Octo: An Open-Source Generalist Robot Policy.\" octo-model.github.io, 2024.
  5. Gemini Robotics Team, Google DeepMind. \"Gemini Robotics: Bringing AI into the Physical World.\" blog.google, 2025.
  6. Hafner, D. et al. \"Dream to Control: Learning Behaviors by Latent Imagination.\" arXiv:1912.01603, 2020.
  7. Hafner, D. et al. \"Mastering Diverse Domains through World Models.\" arXiv:2301.04104, 2023.
  8. ACE Robotics. \"Kairos 3.0-4B: First Open-Source Embodied World Model for On-Device Deployment.\" github.com/ACE-Robotics/Kairos, 2026.
  9. NVIDIA. \"Cosmos 3.0: World Foundation Models for Physical AI.\" research.nvidia.com, 2025.
  10. LeCun, Y. \"A Path Towards Autonomous Machine Intelligence.\" OpenReview, 2022.
  11. DreamGen Benchmark Team / NVIDIA. \"DreamGen: A Benchmark for Video Generation and State Prediction in Robotics.\" 2025.
  12. Yang, S. et al. \"Kairos-HomeWorld: Generative World Model for Interactive Home Scenes.\" arXiv, 2026.
  13. Song Chan Hee et al. \"WorldModelBench: Judging Video Generative World Models via Physical-based Evaluation.\" UC Berkeley, UCSD, NVIDIA, MIT, 2025.

━━━ ━━━ ━━━

*本文仅聚焦技术分析,不构成投资建议。*

微软的武林秘籍:Project Solara,重塑AI江湖的Agent新范式

Yann LeCun 最新论文深度解析:从 AGI 幻象转向超人适应性智能(SAI)

奇点前夜:马斯克预言 2026 AGI,底层架构准备好了吗?

操作本能理论重磅突破|清华姜峣重构具身智能底层范式

Google DeepMind 论文论证:大语言模型永远不会产生意识

影响力换主权:拆解中国 AI 开源权重的"闪电战"战略

本文整理自微信公众号 LeisureLinux 的原创内容(Linux / AI / 安全 硬核技术)。

· 阅读原文(微信公众号)

· 关注公众号 LeisureLinux,第一时间获取技术深度内容。

LeisureLinux 公众号二维码(微信扫一扫关注)