——AFM 3 Core Advanced 如何把 200 亿参数模型塞进 NAND 闪存,在 iPhone 上跑 Agent
WWDC26 上,Apple 发布了第三代 Apple Foundation Models(AFM 3)全家桶:5 个模型、1 个全新的闪存路由架构、以及一个直击业界痛点的方案——如何让 200 亿参数模型在终端设备上运行,而不占用宝贵的 DRAM。
这是 Apple 给所有本地 AI 开发者的一份答案:大模型可以不上云,但也不需要死磕 DRAM 的物理天花板。
━━━ ━━━ ━━━
① 端侧 AI 的天花板:DRAM
过去几年,端侧 AI 模型一直做不大,原因很简单——所有参数必须塞进 DRAM。
对,就是手机里那个你小心翼翼不够用的运行内存。iPhone 16 基础款 8GB,Pro 款也不过 12GB。一个 7B 的 INT4 量化模型已经吃掉 3.5GB,20B 模型更别想——纯粹的物理限制。
业界有两种选择:
- 压缩到能塞进 DRAM → 质量打折
- 上云跑 → 隐私、延迟、合规都成问题
Apple 选了第三条路。
② AFM 3 Core Advanced:20B 参数,存在闪存里
AFM 3 Core Advanced 是本次发布的核心。它是一个 200 亿参数的多模态稀疏 MoE 模型,但它的重量不堆在 DRAM 里,而是整体存放在 NAND 闪存中——和你的照片、app 共用存储空间。
核心机制分解:
2.1 IFP:Instruction-Following Pruning
这是 Apple Research 自研的稀疏剪枝技术。传统的 MoE(Mixture of Experts)每生成一个 token 都要动态换入换出专家权重,NAND-to-DRAM 那点可怜带宽根本扛不住。
IFP 的创新在于:路由决策只做一次——在 Prompt 进入时。
- Lightweight 的 dense 模块分析用户指令
- 从 20B 参数的池子里锁定 1\~4B 最相关的专家
- 把这些专家的权重搬进 DRAM,配合始终激活的 Shared Experts
- 同一个固定配置生成所有 token
这意味着:NAND 到 DRAM 的数据传输只发生在 Prompt 阶段,生成阶段完全不用动静态权重。
2.2 动态激活 1B \~ 4B
简单任务——比如查天气——激活 1B 参数。复杂推理——比如处理多模态对话——激活 4B。弹性调整,按需取用。
2.3 多模态能力
AFM 3 Core Advanced 原生支持多模态:
- 文本——全场景 Siri、写作辅助
- 语音——自动语音识别(ASR)+ 文本转语音(TTS),表达自然度比上一代提升 +0.28 MOS
- 图像理解——照片分析、视觉问答
③ 全家桶定位:AFM 3 五虎将
| 模型 | 参数规模 | 部署位置 | 定位 |
|---|---|---|---|
| AFM 3 Core | 3B dense | 设备端 | 通用日常推理 |
| AFM 3 Core Advanced | 20B sparse (1\~4B active) | 设备端 (NAND → DRAM) | 多模态 + Agent |
| AFM 3 Cloud | 未公布 | PCC 云端 | 服务器端主力模型 |
| ADM 3 Cloud | 未公布 | PCC 云端 | 图像生成/编辑 |
| AFM 3 Cloud Pro | 未公布 | Google Cloud NVIDIA GPU | 复杂 Agent、长程推理 |
注意 Cloud Pro 跑在 Google Cloud 的 NVIDIA GPU 上,但通过 Private Cloud Compute 做隐私保障。
④ 企业视角:这意味着什么?
对于无法使用云推理的企业来说,这是一个全新选择。
4.1 DRAM 墙被打破了
以前本地 Agent 能做 3B 参数不错了。现在 Apple 给出了 20B 参数端侧部署 的方案。虽然 active 部分只有 1\~4B,但总参数量级的不同意味着模型的深度和知识面远超过去。
4.2 隐私与合规
所有 on-device 推理完全在本地完成——没有数据出设备,满足医疗、金融等强监管行业的隐私合规要求。
4.3 混合推理成为架构决策
简单请求 → 设备端(又快又安全)
复杂任务 → Cloud Pro(能力更强)
Apple 还没有公布什么时候请求会上云、这个路由是否对开发者透明——Enterprise 架构师需要关注 summer 技术报告。
⑤ 技术亮点速览IFP 的学术基础
Apple 的 IFP 论文发表在 Apple Machine Learning Research 上,核心结论:
- 3B active 参数的稀疏模型,在数学和编程任务上比 3B dense 模型高出 5\~8 个百分点
- 性能媲美 9B dense 模型,但推理效率大幅领先
- decoding 效率和同规模 dense 模型相当——因为路由只做一次
TTS 效果惊艳
AFM 3 Core Advanced 在语音合成上的评分(MOS 5 分制):
- 通用语音:4.15(2025 基线 3.87)
- 对话语音:4.24(2025 基线 3.82)
0.1 分的 MOS 提升已经被认为是\"非常明显的变化\",这个差距是 +0.28 / +0.42。
⑥ 一些需要关注的问题
- 完整技术报告要等 summer——更多基准测试数据尚未公布
- 缺乏能效和热耗数据——对端侧部署至关重要的指标
- Flash 寿命问题——持续从 NAND 读权重对闪存寿命的影响需要实操验证
- 请求路由透明度——什么时候走设备、什么时候走 PCC,对企业合规审计很重要
━━━ ━━━ ━━━
总结
Apple 的 AFM 3 Core Advanced 不是一次渐进式升级,而是一次架构级别的思路转变——既然 DRAM 不够用,那就别硬塞进去。
把参数池放在 NAND 里,用 IFP 做一次性路由选择,用 1\~4B 的 DRAM 占用换取 20B 参数的知识储备,这可能是 2026 年我们看到的对端侧 AI 影响最深远的架构创新之一。
技术报告的完整 benchmarks 要等到 summer,但方向已经足够清晰:端侧 AI 的上限,不再被 DRAM 锁死了。
━━━ ━━━ ━━━
*🤖 本文基于 Apple Machine Learning Research 官方博客、VentureBeat 报道及第三方业界评论整理。*
玩转本地大模型(LLM):拒绝吃灰,5个硬核且实用的落地玩法
从 Ollama 到 vLLM:本地大模型从"跑起来"到"跑得飞起"的必经之路
单卡巅峰:RTX 5090 本地模型选型策略与 Ollama 推理栈深度实践
Ubuntu 26.10 上下文感知桌面深度解读:AI 能力全景扫描
深度拆解:从 Kirin 叠层架构到芯片级 MEMS 主动散热的技术演进
端侧 AI 的"性能跳跃":Gemma 4 配合 ExecuTorch 实现 3 倍速飞跃深度解析
常见问题(FAQ)
Q1:这篇文章主要讲什么? ——AFM 3 Core Advanced 如何把 200 亿参数模型塞进 NAND 闪存,在 iPhone 上跑 Agent Q2:还有哪些关键事实? ⑤ 技术亮点速览IFP 的学术基础 Apple 的 IFP 论文发表在 Apple Machine Learning Research 上,核心结论: - 3B active 参数的稀疏模型,在数学和编程任务上比 3B dense 模型高出 5\~8 个百分点 - 性能媲美 9B dense 模型,但推理效率大幅领先 - deco… Q3:有哪些值得注意的细节? ——AFM 3 Core Advanced 如何把 200 亿参数模型塞进 NAND 闪存,在 iPhone 上跑 Agent WWDC26 上,Apple 发布了第三代 Apple Foundation Models(AFM 3)全家桶:5 个模型、1 个全新的闪存路由架构、以及一个直击业界痛点的方案——如何让 200 亿参… Q4:核心结论是什么? ② AFM 3 Core Advanced:20B 参数,存在闪存里 AFM 3 Core Advanced** 是本次发布的核心。