← LeisureLinux 文章索引
LeisureLinux · 微信公众号文章

Sutton 在 WAIC 把 AI 的天花板切开了:人类数据时代结束了,经验时代到来

AI/Agent 阅读原文(微信)↗

我们以为 AI 已经「看见」了世界,其实它只是在复述人类说过的话。——Richard Sutton · WAIC 2026 主论坛

2026 年 7 月 17 日,上海。图灵奖得主、强化学习之父 Richard Sutton 站在 WAIC 主论坛的讲台上,用一个半小时,把当下生成式 AI 的天花板,冷静地切开。

他的判断很直白:我们拥有的,只是计算的胜利,不是真正的智能。通用人工智能(AGI)远未到来;下一轮范式切换,将从「人类数据时代」迈入「经验时代」。

本文脉络

01

重新定义智能

02

人类数据时代之困

03

经验时代的路径

01 · CHAPTER ONE

重新定义「智能」

什么是智能?词典说,是获取与应用知识的能力;心理学家威廉·詹姆斯说,是为了达成目标,可以灵活选用完全不同的手段。

Sutton 更进一步,给出强化学习视角下的答案:智能,是通过行为适应环境、持续完成目标的能力

心理学、认知科学、传统 AI、神经科学至今各守边界,没有一门统一的学科能同时解释人类、动物、机器三类主体的智能运行规律。而 Sutton 深耕数十年的强化学习,正是打通生物智能与机器智能的底层逻辑:婴儿学步、动物觅食、机器人抓取,核心都是「行动——观察——奖励——迭代优化」的闭环。

「我们最终需要的机器,是一台可以从自身经验里自主学习的机器。」——阿兰·图灵,1947

这个埋藏了近八十年的构想,正如维克多·雨果所言——恰逢其时的思想,永远势不可挡。AI 行业即将迎来范式切换。

02 · CHAPTER TWO

人类数据时代,已触碰到天花板

我们今天见到的大模型,本质都属于「人类数据时代」的产物。它有三个特征:

01

预测下一个 token: 训练目标只是复刻人类文本、模仿人类标注,靠 RLHF 微调,而不是自我探索。

02

本质只有一件事: 知识搬运,把人类历史沉淀的文字、图片、观点批量转移到模型内部。

03

依赖离线静态数据: 数据是过去人类留下的内容,不是模型自身行动产生的反馈。

这套范式支撑了行业十年爆发,但已撞上四面墙。

数据见底: 高质量人类文本快速耗尽,互联网增量优质内容逐年萎缩,没有源源不断的新燃料。

无法创造: 只能拼接、重组人类已经写过、创造过的内容,无法自主发现物理规律、全新定理。

幻觉无解: 没有目标、没有真实环境反馈,模型不知道自己的输出是对是错,更无从修正。

苦涩的教训: 人工向系统硬编码人类知识的路径,长期一定输给大规模计算 + 自主探索。今天的大模型,恰恰是「人类知识编码」的极致形态。

参数越大、算力越强,只能代表拟合人类数据的能力更强,不代表拥有了目标、感知、试错、进化。今天的大模型,像一本装订精美的百科全书——它储存了所有文字,却从未见过真实世界。

03 · CHAPTER THREE

经验时代:第一视角交互驱动智能进化

未来 AI 的唯一主线,是彻底告别静态数据集,进入经验驱动的时代

静态数据,是别人过去留下的记录;经验数据,是智能体自己行动、自己观察环境变化、接收环境给出的奖励或惩罚信号,是动态、实时、伴随行为持续生成的数据流。

人和动物的一生,都靠经验学习。婴儿摔倒、伸手触碰物体、根据结果调整动作;猎手根据猎物位置调整路线——全部是「行动 → 观察 → 反馈 → 优化」。

经验数据的三个核心信号

行为 Action · 观测 Observation · 奖励 Reward。三者共同定义智能体的目标,也是强化学习的核心骨架。

这套数据不会枯竭:智能体越强,能探索的场景越多,生成的经验数据越丰富,形成正向循环,彻底摆脱对人类存量数据的依赖。

只有经验时代,才能真正解决大模型的底层缺陷:

拥有真实目标: 依靠环境奖励定义任务方向,不再无意义续写文本。

自主校验真伪: 行动之后可接收现实结果,自动修正错误认知,从根源缓解幻觉。

具备创造新知识的能力: 在物理世界、模拟环境里试错探索,发现人类从未总结过的规律。

打通数字与物理世界: 适配机器人、工业控制、自动驾驶等实体场景。

「短期之内,把人类知识塞进系统可以快速拿到效果;拉长十年周期,依靠海量算力、通用搜索、自主学习的路径,一定会碾压所有人工定制方案。」——苦涩的教训,2026

Sutton 并不反对大模型,也不反对闭源商业产品。但他坚决反对封闭经验——模型可以闭源,智能体和环境交互、自主获取经验的底层能力,必须开放探索。

∞ · POSTSCRIPT

下一轮竞赛,是「经验接口」的竞赛

未来十年,AI 的核心竞赛不再是参数竞赛、token 竞赛,而是经验接口的竞赛

更低成本的传感器、高保真物理仿真引擎、通用奖励建模框架、终身强化学习架构、机器人具身交互平台——这些才是下一代 AI 的核心基建。

通用人工智能的终点,一定是无数智能体依靠自身经验、在真实世界里持续学习、不断进化。图灵在七十多年前埋下的种子,终将在经验时代真正开花结果。

后记: 本次为现场媒体整合完整版,结合网易、文汇报、中国青年网、第一财经多家权威现场实录交叉校对,完整还原演讲结构与核心论点。WAIC 官方暂未放出逐字英文原稿,若与日后官方版本有差,以官方为准。

延伸阅读:Richard Sutton & David Silver,《Welcome to the Era of Experience》(2025);Richard Sutton,《The Bitter Lesson》(2019)。

#WAIC2026      #RichardSutton      #强化学习      #苦涩的教训      #经验时代      #AGI      #AI观察

END

我是 LeisureLinux,一个喜欢把硬核演讲翻译成普通人能读懂语言的 Linux 老兵。

如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。

The Bitter Lesson(苦涩的教训):70 年 AI 史最沉重的一条法则(v3 修订)纯NumPy手撕Ilya推荐论文!今日GitHub热点:AI代理正在接管终端 从「开悟」到「垂范」:世界模型如何重构具身智能的底层逻辑 智谱Zcode 3.0:GLM-5.2 撑起的 Agentic 开发环境,让 AI 当主力开发者 大模型的默认大脑:Anthropic 发现 Claude 内部存在意识理论的数学对应物

本文整理自微信公众号 LeisureLinux 的原创内容(Linux / AI / 安全 硬核技术)。

· 阅读原文(微信公众号)

· 关注公众号 LeisureLinux,第一时间获取技术深度内容。

LeisureLinux 公众号二维码(微信扫一扫关注)