2026 年 6 月 8 日,苹果在 WWDC 上发布了搭载 Apple Intelligence 的全新 Siri AI。它不是一次常规的升级,而是 Siri 自 2011 年诞生以来最彻底的一次重构。
个人语境理解、屏幕感知、跨应用操作、世界知识——这些能力之所以能在 iOS 27 / macOS 上完成,核心驱动力不在云端,而在本地芯片的算力突破。
这篇文章带你回顾 Siri 十五年的进化史,并从芯片架构的视角解读这次质变背后的技术基石。
━━━ ━━━ ━━━
一、Siri 十五年进化史:一条从云端到本地的路2011:iPhone 4S 上的\"玩具\"
Siri 最初来自一个 2010 年发布的独立 App,苹果在同年 4 月收购后将其整合进 iPhone 4S。这个版本能做的事情极其有限:定闹钟、发短信、查天气、找餐厅。语音识别全部走云端,网络一断就变哑巴。
这在当时是革命性的——但回头看,就是个大号语音控制面板。
2012-2015:缓慢扩展
iOS 6 加入体育/电影/餐厅查询;iOS 7 引入更自然的男声/女声,集成维基百科搜索;iOS 8 加入\"Hey Siri\"(需插电)、Shazam 音乐识别、HomeKit 控制。
这个阶段 Siri 的核心问题始终没有解决:所有语音数据都要上传到苹果服务器处理后返回结果,延迟高、隐私差、离线无用。
2016-2018:第三方开放与 Shortcuts
iOS 10 向第三方开放 SiriKit,能通过语音叫车(Uber)、发微信(WhatsApp)、支付(Square Cash)。Siri Shortcuts 是 iOS 12 的亮点——用户可以自定义\"说一句话执行一串操作\"。
Shortcuts 的发布暴露了一个尴尬的事实:用户对 Siri 原生能力的期待已经被降到了\"触发器\"层级。说\"晚安\" → 关灯 + 锁门 + 播放睡眠白噪音。好用,但本质上是个语音宏。
2021:转折点——本地处理
iOS 15 是 Siri 历史上最重要的转折点之一。苹果首次将语音识别从云端迁移到设备端——利用 Neural Engine 完成本地语音处理。效果是质变的:
- 响应速度从\"说等说等\"变成了即说即应
- 大部分请求无需联网即可处理
- 语音数据不再上传,隐私大幅提升
这是一个架构级的重构。从这一刻起,Siri 才开始从\"语音玩具\"向\"本地智能助手\"转型。
2023-2025:AI 时代的铺垫
iOS 17 去掉了\"Hey\"前缀,说\"Siri\"即可激活;可以连续发出多个指令无需重新唤醒。但与此同时,Google Assistant 和 ChatGPT 已经大幅拉开了差距——Siri 在对话能力、上下文理解、多模态等方面明显落后。
转折的临界点在 2025-2026 年到来。
2026:Siri AI——本地智能的集大成者
WWDC 2026 上发布的 Siri AI,由 Apple Intelligence 驱动,核心能力包括:
- 个人语境理解:知道你正在看什么、和谁在聊、在哪个 App 里操作
- 屏幕感知:识别屏幕上显示的内容(文字、图片、按钮),据此执行操作
- 跨应用执行:\"把这张照片里的电话号码存到通讯录,再发条短信\"——一句话完成
- 世界知识整合:可实时检索网络信息回答问题
- 历史对话记忆:Siri AI 拥有专属 App 保存对话记忆,可跨设备接续对话
- 语音定制:用户可调节 Siri 的语速、语调、表达方式
这些能力的背后,是一个早就开始铺垫的工程:用本地芯片让 AI 推理在设备端运行。
━━━ ━━━ ━━━
二、从芯片看 Siri AI:CPU/NPU 的算力革命
如果说 iOS 15 的本地语音识别是\"把一个小模型搬到了设备上\",那么 2026 年的 Siri AI 则是\"在设备上跑起了大型语言模型\"。两者对芯片的要求截然不同。
算力量级的变化
| 能力 | 2021(iOS 15) | 2026(iOS 27) |
|---|---|---|
| 语音识别模型 | \~100MB | 小型 LLM + 本地 Embedding |
| 本地推理类型 | 单步语音转文字 | 多步推理 + 上下文 + 多模态 |
| 单次推理 TOPS 需求 | \< 1 TOPS | 5-30 TOPS |
| 离线可用性 | 基本 | 大幅提升 |
M5 芯片:为本地 AI 打造的架构
2025 年底发布的 Apple M5 芯片,某种意义上就是为 Siri AI 铺路的产品。它的 Neural Engine 达到了约 38 TOPS 的算力。但苹果做了一件更有意思的事:在每个 GPU 核心中集成了专用的 Neural Accelerator(神经加速器)。
这意味着什么?
传统架构下,AI 模型在 CPU 和 NPU 之间来回搬数据——内存带宽是真正的瓶颈。M5 通过统一内存架构和 GPU 内嵌 Neural Accelerator,实现了:
- 数据和权重不需要在不同芯片间搬运——CPU/GPU/NPU 共享同一个内存池
- 推理过程更加低功耗——单次推理比传统需要 CPU-GPU 来回拷贝的方案节能 60% 以上
- 持续推理不再是问题——不像云端 GPU 跑大模型需要庞大散热,M5 可以在 MacBook Air 的无风扇设计中稳定运行 AI 推理
A20 芯片:2nm 工艺的加持
2026 年随 iPhone 18 系列推出的 A20,是苹果首款基于台积电 2nm(N2)工艺 的芯片。相比 M5 的 3nm,2nm 带来的不只是更高的晶体管密度,更重要的是:
- 更多的晶体管分配给 Neural Engine,直接扩展 NPU 规模
- 内存子系统升级——更大的缓存和更高带宽,支撑更大的本地模型
- 能效比的大幅跃升——在同样的功耗下,2nm 比 3nm 多跑约 15-20% 的推理量
这三点加起来,让 iPhone 可以在设备端运行比以往复杂得多的 AI 模型。Siri AI 的\"个人语境理解\"和\"屏幕感知\"能力,正是建立在这个基础上的。
Core AI:开发者生态的引擎
苹果还更新了 Core ML 为 Core AI,专门为 Apple Silicon 优化了 AI 模型的集成接口。这意味着第三方开发者可以:
- 将本地大模型直接嵌入自己的 App
- 利用 Siri AI 的\"屏幕感知 + 跨应用执行\"能力
- 在设备端完成推理,数据不出设备
这是一个生态级别的能力开放。苹果没有把 Siri AI 做成一个封闭的\"超级 Siri\",而是把它做成了一整个本地 AI 能力平台。
━━━ ━━━ ━━━
三、为什么\"本地\"这件事如此重要隐私
Siri AI 的大部分推理完全在设备端完成。涉及复杂推理需要云端的请求,苹果使用 Private Cloud Compute——由 NVIDIA 芯片驱动的专用服务器,用户数据既不存储也不对苹果可见。
这解决了\"AI 助手很智能但总在偷听\"的核心矛盾。
延迟
本地推理的响应时间在 10-50ms 量级,而云端推理最少也要 200-500ms。Siri AI 的\"屏幕感知\"和\"跨应用操作\"之所以能做到\"指哪打哪\"的体验,就是靠本地推理的毫秒级响应。
离线可用
这是被很多人忽略的点。苹果的策略是:能用本地完成的,绝不上传;必须上传的,在本地先完成预处理。这意味着即使在网络不佳的环境下,Siri AI 依然可以完成大部分日常操作。
━━━ ━━━ ━━━
四、结语:Siri 十五年后终于找到了自己的路
回顾 Siri 的十五年,一条清晰的主线浮现出来:
2011-2015——语音控制面板,算力和模型都不够
2016-2020——Shortcuts 时代的自我安慰,绕过能力短板
2021——本地语音识别首次上线,架构级转型启动
2021-2025——数据中心训练 + 设备端推理能力逐渐成熟
2026——Apple Silicon + Neural Engine 算力达到临界点,Siri AI 诞生
Siri AI 成功地证明了:本地 AI 这条路是可行的,前提是你的芯片要能扛得住。当 Google 和 OpenAI 在疯狂堆云端 GPU 的时候,苹果选择了一条完全不同的路——把所有能做的推理都搬回用户的设备上。
这条路走了十五年才走到今天。但走到的时候,它带来的体验是\"隐私、速度、离线可用\"三个维度的同时满足——这一点,纯云端的方案永远做不到。
━━━ ━━━ ━━━
后记: 从 iPhone 4S 到 iPhone 18,从云端识别到本地 LLM,Siri 的十五年恰好浓缩了整个 AI 行业从\"数据中心崇拜\"到\"边缘智能\"的路径转换。欢迎关注 LeisureLinux,获取更多深度技术解读。
深度拆解鸿蒙"龙虾"小艺 (OpenClaw):系统级 Agent 的架构演进与边缘算力实践
Apple 端侧 AI 闪存路由架构:20B 参数不碰 DRAM
Apple Time Capsule 的"终结"与 NetBSD 的重生:深度架构分析
零刻 SER10 本地 AI 推理实测:NPU 的幻象与 OpenClaw 的现实