← LeisureLinux 文章索引
LeisureLinux · 微信公众号文章

Apple 端侧 AI 闪存路由架构:20B 参数不碰 DRAM

AI/Agent 阅读原文(微信)↗

——AFM 3 Core Advanced 如何把 200 亿参数模型塞进 NAND 闪存,在 iPhone 上跑 Agent

WWDC26 上,Apple 发布了第三代 Apple Foundation Models(AFM 3)全家桶:5 个模型、1 个全新的闪存路由架构、以及一个直击业界痛点的方案——如何让 200 亿参数模型在终端设备上运行,而不占用宝贵的 DRAM

这是 Apple 给所有本地 AI 开发者的一份答案:大模型可以不上云,但也不需要死磕 DRAM 的物理天花板。

━━━ ━━━ ━━━

① 端侧 AI 的天花板:DRAM

过去几年,端侧 AI 模型一直做不大,原因很简单——所有参数必须塞进 DRAM

对,就是手机里那个你小心翼翼不够用的运行内存。iPhone 16 基础款 8GB,Pro 款也不过 12GB。一个 7B 的 INT4 量化模型已经吃掉 3.5GB,20B 模型更别想——纯粹的物理限制

业界有两种选择:

  1. 压缩到能塞进 DRAM → 质量打折
  2. 上云跑 → 隐私、延迟、合规都成问题

Apple 选了第三条路。

② AFM 3 Core Advanced:20B 参数,存在闪存里

AFM 3 Core Advanced 是本次发布的核心。它是一个 200 亿参数的多模态稀疏 MoE 模型,但它的重量不堆在 DRAM 里,而是整体存放在 NAND 闪存中——和你的照片、app 共用存储空间。

核心机制分解:

2.1 IFP:Instruction-Following Pruning

这是 Apple Research 自研的稀疏剪枝技术。传统的 MoE(Mixture of Experts)每生成一个 token 都要动态换入换出专家权重,NAND-to-DRAM 那点可怜带宽根本扛不住。

IFP 的创新在于:路由决策只做一次——在 Prompt 进入时

  • Lightweight 的 dense 模块分析用户指令
  • 从 20B 参数的池子里锁定 1\~4B 最相关的专家
  • 把这些专家的权重搬进 DRAM,配合始终激活的 Shared Experts
  • 同一个固定配置生成所有 token

这意味着:NAND 到 DRAM 的数据传输只发生在 Prompt 阶段,生成阶段完全不用动静态权重。

2.2 动态激活 1B \~ 4B

简单任务——比如查天气——激活 1B 参数。复杂推理——比如处理多模态对话——激活 4B。弹性调整,按需取用。

2.3 多模态能力

AFM 3 Core Advanced 原生支持多模态:

  • 文本——全场景 Siri、写作辅助
  • 语音——自动语音识别(ASR)+ 文本转语音(TTS),表达自然度比上一代提升 +0.28 MOS
  • 图像理解——照片分析、视觉问答

③ 全家桶定位:AFM 3 五虎将

模型 参数规模 部署位置 定位
AFM 3 Core 3B dense 设备端 通用日常推理
AFM 3 Core Advanced 20B sparse (1\~4B active) 设备端 (NAND → DRAM) 多模态 + Agent
AFM 3 Cloud 未公布 PCC 云端 服务器端主力模型
ADM 3 Cloud 未公布 PCC 云端 图像生成/编辑
AFM 3 Cloud Pro 未公布 Google Cloud NVIDIA GPU 复杂 Agent、长程推理

注意 Cloud Pro 跑在 Google Cloud 的 NVIDIA GPU 上,但通过 Private Cloud Compute 做隐私保障。

④ 企业视角:这意味着什么?

对于无法使用云推理的企业来说,这是一个全新选择。

4.1 DRAM 墙被打破了

以前本地 Agent 能做 3B 参数不错了。现在 Apple 给出了 20B 参数端侧部署 的方案。虽然 active 部分只有 1\~4B,但总参数量级的不同意味着模型的深度和知识面远超过去

4.2 隐私与合规

所有 on-device 推理完全在本地完成——没有数据出设备,满足医疗、金融等强监管行业的隐私合规要求

4.3 混合推理成为架构决策

简单请求 → 设备端(又快又安全)

复杂任务 → Cloud Pro(能力更强)

Apple 还没有公布什么时候请求会上云这个路由是否对开发者透明——Enterprise 架构师需要关注 summer 技术报告。

⑤ 技术亮点速览IFP 的学术基础

Apple 的 IFP 论文发表在 Apple Machine Learning Research 上,核心结论:

  • 3B active 参数的稀疏模型,在数学和编程任务上比 3B dense 模型高出 5\~8 个百分点
  • 性能媲美 9B dense 模型,但推理效率大幅领先
  • decoding 效率和同规模 dense 模型相当——因为路由只做一次

TTS 效果惊艳

AFM 3 Core Advanced 在语音合成上的评分(MOS 5 分制):

  • 通用语音:4.15(2025 基线 3.87)
  • 对话语音:4.24(2025 基线 3.82)

0.1 分的 MOS 提升已经被认为是\"非常明显的变化\",这个差距是 +0.28 / +0.42

⑥ 一些需要关注的问题

  • 完整技术报告要等 summer——更多基准测试数据尚未公布
  • 缺乏能效和热耗数据——对端侧部署至关重要的指标
  • Flash 寿命问题——持续从 NAND 读权重对闪存寿命的影响需要实操验证
  • 请求路由透明度——什么时候走设备、什么时候走 PCC,对企业合规审计很重要

━━━ ━━━ ━━━

总结

Apple 的 AFM 3 Core Advanced 不是一次渐进式升级,而是一次架构级别的思路转变——既然 DRAM 不够用,那就别硬塞进去。

把参数池放在 NAND 里,用 IFP 做一次性路由选择,用 1\~4B 的 DRAM 占用换取 20B 参数的知识储备,这可能是 2026 年我们看到的对端侧 AI 影响最深远的架构创新之一。

技术报告的完整 benchmarks 要等到 summer,但方向已经足够清晰:端侧 AI 的上限,不再被 DRAM 锁死了。

━━━ ━━━ ━━━

*🤖 本文基于 Apple Machine Learning Research 官方博客、VentureBeat 报道及第三方业界评论整理。*

玩转本地大模型(LLM):拒绝吃灰,5个硬核且实用的落地玩法

口袋里的 Gemma4 离线本地模型

【转译】11款大模型本地单卡性能横向测评

从 Ollama 到 vLLM:本地大模型从"跑起来"到"跑得飞起"的必经之路

单卡巅峰:RTX 5090 本地模型选型策略与 Ollama 推理栈深度实践

Ubuntu 26.10 上下文感知桌面深度解读:AI 能力全景扫描

深度拆解:从 Kirin 叠层架构到芯片级 MEMS 主动散热的技术演进

端侧 AI 的"性能跳跃":Gemma 4 配合 ExecuTorch 实现 3 倍速飞跃深度解析

常见问题(FAQ)

Q1:这篇文章主要讲什么? ——AFM 3 Core Advanced 如何把 200 亿参数模型塞进 NAND 闪存,在 iPhone 上跑 Agent Q2:还有哪些关键事实? ⑤ 技术亮点速览IFP 的学术基础 Apple 的 IFP 论文发表在 Apple Machine Learning Research 上,核心结论: - 3B active 参数的稀疏模型,在数学和编程任务上比 3B dense 模型高出 5\~8 个百分点 - 性能媲美 9B dense 模型,但推理效率大幅领先 - deco… Q3:有哪些值得注意的细节? ——AFM 3 Core Advanced 如何把 200 亿参数模型塞进 NAND 闪存,在 iPhone 上跑 Agent WWDC26 上,Apple 发布了第三代 Apple Foundation Models(AFM 3)全家桶:5 个模型、1 个全新的闪存路由架构、以及一个直击业界痛点的方案——如何让 200 亿参… Q4:核心结论是什么? ② AFM 3 Core Advanced:20B 参数,存在闪存里 AFM 3 Core Advanced** 是本次发布的核心。

本文整理自微信公众号 LeisureLinux 的原创内容(Linux / AI / 安全 硬核技术)。

· 阅读原文(微信公众号)

· 关注公众号 LeisureLinux,第一时间获取技术深度内容。

LeisureLinux 公众号二维码(微信扫一扫关注)