← LeisureLinux 文章索引
LeisureLinux · 微信公众号文章

口袋里的 Gemma4 离线本地模型

开源/工具 阅读原文(微信)↗

Google 在 2026 年 4 月 2 日正式发布了Gemma 4系列模型。这一次,Google 不仅采用了Apache 2.0开源协议,还针对移动端和边缘计算进行了深度优化。

想要在口袋里(手机端)或电脑上完全离线运行 Gemma 4,可以参考以下深度解读:

{#section path-to-node="3"}

一、 Gemma 4 模型家族:哪款适合你?

Gemma 4 引入了全新的命名体系,主要分为Edge(边缘)Full(全能)两大类:

模型版本 参数量 核心能力 硬件要求 适用设备
[Gemma 4 E2B]{path-to-node="5,1,0,0"} [约 20 亿]{path-to-node="5,1,1,0"} [文本、图像、原生语音]{path-to-node="5,1,2,0"} [5GB RAM (4-bit)]{path-to-node="5,1,3,0"} [入门级手机、嵌入式设备]{path-to-node="5,1,4,0"}
[Gemma 4 E4B]{path-to-node="5,2,0,0"} [约 40 亿]{path-to-node="5,2,1,0"} [文本、图像、原生语音]{path-to-node="5,2,2,0"} [8GB RAM (4-bit)]{path-to-node="5,2,3,0"} [主流智能手机、轻薄本]{path-to-node="5,2,4,0"}
[Gemma 4 26B A4B]{path-to-node="5,3,0,0"} [26B (MoE)]{path-to-node="5,3,1,0"} [复杂逻辑、长文本 (256K)]{path-to-node="5,3,2,0"} [18GB RAM (4-bit)]{path-to-node="5,3,3,0"} [高端 PC、MacBook (M3+)]{path-to-node="5,3,4,0"}
[Gemma 4 31B]{path-to-node="5,4,0,0"} [31B (Dense)]{path-to-node="5,4,1,0"} [最强推理、Agent 工作流]{path-to-node="5,4,2,0"} [20GB RAM (4-bit)]{path-to-node="5,4,3,0"} [工作站、本地服务器]{path-to-node="5,4,4,0"}

注意:E2B 和 E4B 版本支持原生音频输入,这意味着你可以在断网状态下直接对着手机说话,由 AI 进行实时转录和语义处理。

{#section-1 path-to-node="8"}

二、 手机端如何离线运行(iOS/Android)

Google 随模型发布了全新的Google AI Edge Gallery应用程序,这是目前在手机上运行 Gemma 4 最简单的方式。

1. 安装与设置

  • 下载 App:在 Google Play 或 App Store 搜索 "Google AI Edge Gallery"。

  • 模型下载:进入Model Management,选择Gemma 4 E2BE4B进行一次性下载(建议在 Wi-Fi 下完成)。

  • 断网运行:开启手机飞行模式,点击AI ChatAudio Scribe即可开始完全离线、隐私安全的对话。

2. 特色功能

  • Thinking Mode(思考模式):类似于推理模型,开启后模型会展示逻辑推理过程。

  • Agent Skills(智能体技能):可以在本地调用地图(离线版)、日历和邮件草稿功能,实现自动化任务,而数据不经过云端。

{#section-2 path-to-node="15"}

三、 桌面端(PC/Mac)离线运行方案

如果你拥有更高性能的硬件(如 RTX 40/50 系列显卡或 Mac M 系列芯片),可以使用更专业的本地推理框架。

1.使用 llama.cpp / Unsloth (推荐)

目前llama.cpp已支持 Gemma 4 的GGUF格式。推荐使用Dynamic 4-bit (UD-Q4_K_XL)量化版本,在保持精度的同时极大压缩显存占用。

运行示例 (Linux/macOS 终端):

[Bash]{ngcontent-ng-c239877319=""}

# 启动 26B MoE 版本
./llama-cli -hf unsloth/gemma-4-26B-A4B-it-GGUF:UD-Q4_K_XL \
            --temp 1.0 \
            --ctx-size 32768

text

2. 硬件建议

  • Windows 用户:建议使用CUDA 12.x以上环境。尽量避开某些旧版 Runtime,防止 GGUF 输出异常。

  • Mac 用户:利用 Metal 加速,Gemma 4 在 16GB 以上内存的 Mac 上运行流畅度极高。

四、 为什么选择"口袋里的 Gemma 4"?

  1. 绝对隐私:所有的 Prompt、图像和录音都在本地处理,不会上传到任何服务器。

  2. 零成本:无需订阅费,不消耗 Token,只要设备有电就能用。

  3. 超长上下文:即便在本地,26B 版本也支持高达256K的上下文窗口,足以处理一整本技术手册或超长代码文件。

专家提示:在本地运行大模型时,电池消耗会明显增加。建议在进行大规模逻辑推理任务(如生成整个 Sudoku 游戏代码)时连接电源。

你想了解如何在特定的 Linux 环境(如 Debian 13)下编译部署 Gemma 4 吗?

【边缘智算-手把手教你如何在4C4G的香橙派Zero3部署 Gemma4-E2B-Q4 本地模型-哔哩哔哩】 https://b23.tv/1nNP4IG

【Gemma4-26b在 RTX 5090上实测-哔哩哔哩】 https://b23.tv/w7au71f

本文整理自微信公众号 LeisureLinux 的原创内容(Linux / AI / 安全 硬核技术)。

· 阅读原文(微信公众号)

· 关注公众号 LeisureLinux,第一时间获取技术深度内容。

LeisureLinux 公众号二维码(微信扫一扫关注)