如何不联网在手机上跑本地大模型:Google AI Edge Gallery 部署指南
【免费下载链接】galleryA gallery that showcases on-device ML/GenAI use cases and allows people to try and use models locally.项目地址: https://gitcode.com/GitHub_Trending/gallery44/gallery
Google AI Edge Gallery 是一个把开源大模型直接跑在手机上端的侧应用:多轮对话、图像问答、语音转写都在设备内完成。模型加载完成后可断网使用,推理过程不出设备。
🧪 它先替你干这几件事
- 图像问答:你拍一张照片或从相册选一张,它返回物体是什么、场景里在做什么。
- 语音转写:你录 2 分钟语音,它输出实时文字,还能给出翻译。
- 设备控制:你说"把亮度调到 50%",它调用手机的对应设置项直接执行,全程不联网。
⚡ 断网可用的前提条件
- 检查系统:Android 12 及以上(工程 minSdk 为 31),或 iOS 17 及以上。
- 安装应用:Android 从 Google Play 安装,没有 Play 就从最新 release 页拿 APK 直接装;iOS 从 App Store 安装;另有 macOS 版本。
- 下载模型:在应用的模型管理里从列表挑一个(从 Hugging Face 拉取),当前版本官方支持 Gemma 4 系列。
- 断网验证:下载完成后开飞行模式,再发一句话,能正常出字即可长期使用。
- 想改代码再克隆仓库:
git clone https://gitcode.com/GitHub_Trending/gallery44/gallery,用 Android Studio 打开构建。
各能力怎么用
对话:输入话题开始多轮交流;在支持的模型(Gemma 4 系列起)上可打开 Thinking Mode,看到模型逐步的推理过程。
图像:拍照或从相册选图作为输入,模型返回物体识别、视觉谜题答案或详细描述。
音频:录音作为输入,实时转写成文字,支持翻译输出,适合会议记录和素材整理。
设备控制:Mobile Actions 由 FunctionGemma 270m 的微调版本驱动——注意此处"驱动"指运行时调用;模型听懂你的指令后调用手机设置或系统动作,返回执行结果。
🔌 加载自己的 .litertlm 模型
应用支持加载自定义 .litertlm 模型并随时切换。模型以 LiteRT 格式打包,在模型管理面板导入模型文件,也可以粘贴 Hugging Face 的模型地址导入;导入后可与列表中的模型互相切换、删除,并跑基准测试对比表现。加载与删除逻辑集中在 ModelManagerViewModel.kt;要自己加一个 AI 任务模块,看 customtasks/ 目录。
📈 读懂推理性能指标
应用内置基准测试,每轮跑出三个数字:
- TTFT(time to first token):从发送到第一个字出现所用的秒数,越短首响越快;输入越长,这个值越吃亏。
- 解码速度(decode speed,tokens/sec):首字之后的持续生成速度,越高后续输出越快。
- prefill 速度:处理输入部分的速度,同为 tokens/sec,是长上下文档位的主要瓶颈。
判断好坏别看单次数值:同一台设备跑同一个模型做对比,并记录当时用的是 CPU 还是 GPU 加速。
适用边界
这套方案适合要验证设备端大模型、或网络不可用场景的部署;如果你要的是顶级云端模型的对话能力,端侧模型目前够不到。MCP 外部工具接入与 Thinking Mode 仍是实验性功能,后者只在受支持的模型上生效;应用本身处于实验性 Beta 阶段,硬件下限与具体模型的兼容性以官方发布为准。
【免费下载链接】galleryA gallery that showcases on-device ML/GenAI use cases and allows people to try and use models locally.项目地址: https://gitcode.com/GitHub_Trending/gallery44/gallery
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考