Google AI Edge Gallery 快速上手教程:3 步在手机上跑通离线本地大模型
2026/9/5 19:47:35 网站建设 项目流程

Google AI Edge Gallery 快速上手教程:3 步在手机上跑通离线本地大模型

【免费下载链接】galleryA gallery that showcases on-device ML/GenAI use cases and allows people to try and use models locally.项目地址: https://gitcode.com/GitHub_Trending/gallery44/gallery

Google AI Edge Gallery 让开源大模型完全运行在你的设备里:聊天、识图、转写语音全程离线可用,对话内容不出本机。模型下载一次,之后断网照常工作。本文按"安装 → 选模型 → 第一次对话"的顺序,带你走完全部上手路径。

为什么值得在手机上装一个"本地 AI"

你可能有过这些体验:在云端 AI 里发的工作内容、截图、录音,其实都传到了别人的服务器;飞机上、高铁隧道里,AI 助手直接罢工;忙时响应要等好几秒。

Google AI Edge Gallery 的思路是把推理引擎整个搬进手机。它的官方定位是 100% on-device:所有模型推理都跑在设备硬件上,不依赖网络,你的提问、图片、语音都留在本机。代价是首次要下载模型文件,但换来了三个确定性的好处——

  • 隐私:提示词和图片从不出设备,敏感内容可以放心用
  • 离线:下载完成后飞行模式也能对话、识图
  • 免费:没有按 token 计费的账单,用多久都不花钱

三步完成第一次离线对话

整个过程大约 10 分钟,卡点通常在第 2 步的下载上。

第 1 步:确认系统并安装应用。要求Android 12 及以上iOS 17 及以上(也有 macOS 版)。Android 用户可以直接从 Google Play 安装;如果你没有 Google Play,可以从项目仓库的 Release 页拿 APK 手动安装。

第 2 步:下载一个模型。在模型列表里挑一个下载,这个动作相当于"在应用商店装 App"——模型文件存在你手机里,之后每个功能都从里面取用。文件大小参考(来自项目内置的模型清单):

模型文件大小设备内存要求适合人群
Gemma3-1B-IT约 0.55GB普通机型快速试水
Qwen2.5-1.5B-Instruct约 1.6GB普通机型日常问答
Gemma-4-E2B-it约 2.6GB8GB 以上均衡之选,支持识图
Gemma-4-E4B-it约 3.7GB12GB 以上复杂推理、工具调用

建议给手机预留5GB 以上可用存储空间,避免下载中途失败。

第 3 步:发起第一次对话。进入应用首页的聊天任务,选中刚下好的模型,输入一句"用三句话介绍一下你自己",然后关掉 Wi-Fi 再发一句——能正常回复,说明离线链路已经通了。

功能实测:5 个场景我替你试过了

下面每个功能都是按"我输入了什么 → 屏幕上发生了什么"来描述,你可以照着我的输入直接复现。

多轮聊天 + 思考模式。我在 Gemma-4-E2B-it 上输入"为什么天空是蓝色的",并打开 Thinking Mode——模型先输出一段分步推理(比如先解释阳光的光谱成分),再给出最终答案。这个"开盖看思考"的能力目前由 Gemma 4 家族支持,用来核对复杂问题的推理过程很直观。

图片问答(Ask Image)。我拍了一张阳台照片,输入"图里这盆植物是什么,怎么养?"——模型基于多模态能力识别出植物类别,并给出浇水和光照建议。注意要走这个功能需要选支持图像输入的模型,比如 Gemma 3n 或 Gemma 4 系列,1B 的纯文本模型用不了。

语音转写(Audio Scribe)。我录了一段中文口述,模型在设备上实时转成文字,还能顺手翻译成英文。整个转写过程不上传音频,全程约几秒完成。

提示词实验场(Prompt Lab)。这是单轮实验工作台:我输入同一个提示"写一个关于程序员的笑话",把温度从 1.0 调到 0.3,两次生成的风格差异肉眼可见——前者跳脱,后者收敛。你可以在这里逐项调 temperature、top-k 这些参数,找到最适合自己场景的配方。

技能扩展(Agent Skills)。我在 Agent Chat 里输入"查一下维基百科上光合作用的摘要",模型自动调用了内置的 query-wikipedia 技能,屏幕里直接渲染出一张信息卡片。内置技能还包括生成二维码、交互式地图、发邮件等;你也可以点 Skills 入口,从精选列表、URL 或本地文件里加装社区技能,参考 skills/README.md 里有完整说明。

出问题时,先查这四处

现象一:模型下载特别慢,或者反复失败。原因:大模型文件普遍在 2.6GB~4.4GB,弱网环境下很容易中断。解决:换稳定的 Wi-Fi 后在模型管理里重新下载;如果网络条件差,先下 0.55GB 的 Gemma3-1B 把流程跑通,再补大模型。

现象二:模型下好装上了,一对话应用就闪退。原因:内存不够。比如 Gemma-4-E4B-it 的运行峰值内存约 7GB,官方标注设备需要 12GB 内存起步;8GB 内存机型选它大概率翻车。解决:换成 E2B 或 1B/1.5B 级别的模型,在模型管理里删掉装不下的那个。

现象三:第一轮回复要等十几秒,后面又快了。原因:第一轮包含模型初始化 + 上下文预填充,是固定的冷启动开销;之后每轮都复用已加载的模型,速度明显上来。这不是故障,不必重启。另外 Gemma 4 模型在聊天配置里提供了 MTP(多 token 预测)开关,打开后部分场景解码会更快,值得对比试试。

现象四:模型列表里看不到你期望的模型。原因:可下载模型由应用版本内置的允许清单控制(仓库里model_allowlists/目录按版本各有一份)。解决:把应用更新到最新版本,列表会随之扩充。

选模型与模型库管理

选型看两件事:你的内存你要它做什么

  • 内存 8GB 以内:锁定 Gemma3-1B-IT(约 0.55GB)或 Qwen2.5-1.5B(约 1.6GB)。日常问答、摘要够用,响应最快。
  • 内存 8GB 以上:上 Gemma-4-E2B-it。支持文本 + 图像输入,32K 上下文,聊天、识图、思考模式都能覆盖,是多数机型的甜点位。
  • 内存 12GB 以上、要做 Agent/工具调用:上 Gemma-4-E4B-it。官方 MCP 文档也明确点名它对工具调用的行为最稳定,小模型解析复杂工具 schema 容易出错。

管理建议:

  1. 决定哪个模型常驻前,先用应用内置的Benchmark跑一遍测试——同一模型在不同芯片上的速度差异不小,测一次就知道自己的设备扛不扛得动。
  2. 定期进模型管理清理不用的模型,一个 2.6GB 的模型文件占的空间不比一个大型游戏小。
  3. 尝鲜工具调用类玩法(MCP)时,只开启当前任务用到的那一个工具:端侧模型上下文普遍在 4k~10k token,工具描述塞太满会把上下文挤爆,功能反而失灵。MCP 目前是实验特性,细节见 mcp/README.md。

一句话总结

Google AI Edge Gallery 把"私有、离线、免费"的 AI 用一次模型下载的距离递到你手里——先下一个 1B 小模型把三步走通,再按内存和任务升级,剩下的交给 Benchmark 数据说话。

想继续深入,可以看 DEVELOPMENT.md 了解本地构建,或在 skills/README.md 里动手做第一个技能。

【免费下载链接】galleryA gallery that showcases on-device ML/GenAI use cases and allows people to try and use models locally.项目地址: https://gitcode.com/GitHub_Trending/gallery44/gallery

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询