上个月我刷到一条消息,某品牌主打 AI 智能体概念的新手机开启预售,预约人数直接冲到 36 万。评论区吵成一片,有人说这是"下一代手机"该有的样子,有人质疑又是饥饿营销。而我当时的反应有点不合群——因为摆在桌上的那台用了快三年、边框掉漆、电池健康度只剩 78% 的旧安卓机,早被我改造成了一个类似的东西:它能听懂语音指令,能跨应用帮我设闹钟、发消息、记笔记,能在我下班前主动提醒取快递,甚至能根据早上的日程自动生成当日简报。全部增量成本是每个月 12 块的 API 费用。
这篇文章不是来论证"厂商在割韭菜"的,也不是劝你别买 AI 智能体手机。我想做一件更实在的事:把所谓"AI 智能体手机"的卖点彻底拆开,告诉你背后到底是什么技术在起效,然后给出一套我本人跑了两个多月的低成本复刻方案。看完你至少能回答一个问题:那 36 万人抢的东西,对我来说到底值不值。
1. 36万人抢的AI智能体手机,核心卖点拆开无非三块积木
1.1 厂商不说的秘密:这就是"大模型 + 系统权限 + 自动化"
AI 智能体手机铺天盖地的宣传里,高频词永远是"系统级 AI""跨应用操作""主动服务""全程语音"。听起来非常科幻,可落到技术实现层面,翻来覆去逃不开三块积木。
第一块是大模型的意图理解能力。所谓"用自然语言操控手机",本质是让 AI 听懂"明早 8 点提醒我开会"这句话,并把它拆解成"创建提醒、时间=明早8点、内容=开会"。这个动作,靠的是手机里塞了一个云端或端侧的大语言模型,跟机器上焊的是哪颗芯片关系不大。哪怕是三年前的旧手机,只要能发起一个 HTTP 请求,就能获得同样的"听懂人话"能力。
第二块是系统权限和自动化工具。AI 听懂之后总得动手干活,跨应用操作依赖的是系统级助手协议、无障碍服务、快捷指令、剪贴板、通知栏权限这些"管道"。说得直白点,就是让 AI 能替你点屏幕、填表单、调起 App、发送内容。这套东西在 Tasker、快捷指令这些工具里已经存在很多年了,并不是新发明。
第三块是场景感知与主动触发。所谓"主动服务",靠的是日历、位置、WiFi、时间、通知事件这些信息的联动。到了某个点、进了某个区域、收到某一类通知,就触发一条自动化流程。这同样不是新东西,很多自动化玩家十年前就在玩了。
三块积木拼起来,就是一台 AI 智能体手机的核心体验。厂商花了很大力气把它们打磨成软硬一体的产品,但如果你只看"功能上有还是没有",那差异就被大大压缩了。
1.2 为什么这个组合能卖上万块,单独做却不神秘
厂商把这三样东西封装成一个产品,当然有不可否认的工程价值。端侧模型、安全沙箱、系统级 API、售后生态,每一环都要投入大量研发,体验和稳定性也确实比自己拼装强。可换个角度看,发布会上一页页 PPT 演示的场景——语音设提醒、跨应用转发、自动生成摘要、主动日程建议——你在旧手机上用一个十几块的 API 套餐,一个个复刻出来完全可行。
我并不是说厂商在骗钱。任何成熟产品都包含"封装红利",你花钱买的是省心、稳定和一整套售后保障。但如果你想搞清楚这笔钱到底花在了哪里,本文的核心判断是:AI 智能体手机卖的不是魔法,是封装。愿意折腾的人,确实可以用极低的成本逐件买到这些积木。
2. 12块/月怎么落地:先画一张最小可用的Agent架构
动手之前,先把账算清楚,再把架构想明白。这是我和很多一上来就装各种"AI 手机助手 App"的人最大的区别——前者是在搭系统,后者只是多装了几个聊天机器人。
2.1 12块钱到底买到了什么
先说费用构成。我选的是一个国产大模型 API,按 token 计费。日常使用强度大概是每天 20 到 40 次请求,多数是几十到几百 token 的短指令,偶尔用来做长文本总结。这样跑下来,一个月账单基本落在 10 到 15 元之间,取个平均就是 12 块。
给不熟悉 API 计费的朋友补个概念。大模型 API 按 token 收钱,token 可以粗略理解成"模型读取的字词碎片",1 个汉字大约对应 1 到 2 个 token。现在国产模型价格卷得厉害,输入侧一两块钱能买几百万 token,输出侧贵一些但也不至于"用不起"。按我的使用频率和上下文长度,几十次调用一天,一个月十几块,完全在可接受范围内。
这里有个要命的细节:12 块/月的前提是把模型用在刀刃上。只让它做意图识别和轻量生成,长文本总结这种重活偶尔用一次。如果天天让它写几千字文章、批量分析上百页文档,账单会轻松跳到几十上百。我第一个月就吃过这个亏,后面第五节细说。
2.2 整套方案由四个模块组成
我不画架构图,直接按数据流把模块摆出来,你顺着数字走一遍就清楚了。
- 入口模块:接收声音或文字指令。我用的是手机自带语音助手 + 桌面小部件 + 快捷方式,把"语音到文字"这步解决掉。
- Agent 网关:一台旧电脑或者手机上的 Termux 里跑着一个小服务,负责把指令转发给大模型,让大模型做两件事——理解意图 + 输出结构化任务参数,然后网关再决定调用哪个工具执行。
- 工具执行层:手机本地安装的自动化工具,比如安卓上的 Tasker、HTTP Shortcuts,或者 iOS 上的快捷指令,负责真正操作系统。
- 记忆与偏好存储:一个本地 JSON 文件,记下常用地址、联系人、习惯提醒时间,让 Agent 越用越顺手。
整套链路拆到底就是"听指令 → 大模型规划 → 系统执行 → 反馈结果"。这和厂商的 AI 智能体手机没有代差,只是他们封装得更深、更稳定、更快罢了。你的手机、我的旧安卓机,跑的是同一条逻辑。
3. 从零搭建:把旧手机调教成AI智能体手机的完整步骤
下面进入实操环节。我按"大脑 → 手脚 → 耳朵 → 记忆"四个层次来讲,每一步都给出可复制的方案,照着做基本都能跑通。
3.1 先搭一个会规划的"大脑"
Agent 网关的代码并不复杂。我在旧笔记本上装好 Python 环境,用 Flask 起了个 HTTP 服务,核心思路是:前端指令进来后,通过提示词约束大模型输出固定格式的 JSON,让它只做意图识别和参数提取,不废话、不自由发挥。代码如下:
# agent_gateway.py from flask import Flask, request, jsonify import requests import json app = Flask(__name__) SYSTEM_PROMPT = """ 你是手机智能体的任务规划器。根据用户指令,只输出一个JSON对象: {"intent": "set_alarm|create_note|send_message|query_weather|review_schedule|other", "params": {...}} intent只允许列出的枚举值。params里放执行该操作所需的最小参数,时间一律转换为24小时制并带日期。 不要输出任何解释或额外内容。 """ def call_llm(user_text): resp = requests.post( "https://api.example.com/v1/chat/completions", headers={"Authorization": "Bearer 你的KEY"}, json={ "model": "你选的模型名", "messages": [ {"role": "system", "content": SYSTEM_PROMPT}, {"role": "user", "content": user_text} ], "temperature": 0.1 }, timeout=15 ) data = resp.json() content = data["choices"][0]["message"]["content"] # 去掉模型偶尔会加的 ```json 围栏 cleaned = content.strip().lstrip("```json").rstrip("```") return json.loads(cleaned) @app.route("/agent", methods=["POST"]) def agent(): text = request.get_json().get("text", "") plan = call_llm(text) return jsonify(plan) if __name__ == "__main__": app.run(host="0.0.0.0", port=8080)这段代码的要害在于:把大模型的自然语言输出,转成机器可执行的结构化指令。比如我说"明天早上 7 点 45 提醒我带身份证",它返回的就是:
{ "intent": "set_alarm", "params": { "time": "07:45", "date": "2026-06-11", "note": "带身份证" } }有了这种结构化输出,后面的自动化才有意义。没有它,模型只是在聊天;有了它,模型才是在干活。
不想用旧电脑的话,还有两个替换方案:把服务跑在手机里的 Termux 上,或者放到树莓派、软路由里。我实测过 Termux 方案,性能完全够用,唯一的代价是手机在家里不能随意断网。平时出门在外,我依赖的是自己在云上长期挂机的一台小服务器,那部分成本另算,如果你只在家里玩,零额外硬件成本就能跑起来。
3.2 再让AI拥有"手脚":连接手机自动化工具
大脑有了,手脚怎么接?安卓上我用的是两件免费工具:HTTP Shortcuts 和 Tasker。
思路是:在 HTTP Shortcuts 里新建一个请求,把语音或文字通过 POST 发给 Agent 网关,然后解析返回的 JSON,按 intent 字段分流到不同的自动化动作。
- intent 是 set_alarm,就调起系统闹钟 App,填入精确时间——Tasker 里有现成的"设置闹钟"动作;
- intent 是 create_note,就调用备忘录的分享接口写入;
- intent 是 send_message,就弹一个确认框,确认后通过短信或微信发送;
- intent 是 query_weather,就请求天气接口再朗读结果。
配置完一轮之后,以后想新增能力,只需要在 Tasker 里多加一个分支,或者在网关系关里多定义一个 intent 枚举,不需要动其他代码。
iOS 用户也不用叹气,快捷指令能做同样的事:用"获取 URL 内容"请求网关,用"如果"条件判断 JSON 里的 intent,再调用对应的系统操作,逻辑一模一样。
这里有一个我反复强调的经验:能走系统原生 Intent 的,千万别走无障碍模拟点击。原生方式稳定、不打断用户操作、不会被系统拦截;模拟点击虽然万能,但一次误触可能把整页设置改得乱七八糟。后面坑里会细讲。
3.3 语音入口与"主动提醒"怎么实现
语音入口是衡量"智能体手机"体验的关键。我的做法是:给手机自带语音助手设定一个自定义指令,说出"问问 AI"或者某个自定义短语,唤起一个 URL Scheme,把语音转出来的文字发到 Agent 网关。全程用的是手机自带能力,不用额外装 App。
主动提醒靠的是触发器。Tasker 里能监听大量事件:时间到达、日历事件、WiFi 连接变化、电量变化、通知内容匹配。举两个我实测有效的例子:
- 每天早上 8 点,网关自动查当天天气和日程摘要,生成一段"今日简报"推送到通知栏;
- 当我连上公司 WiFi 时,网关收到事件后提醒我"把昨天的工作日报发了"。
从体验上看,这就是厂商宣传的"主动服务",只是少了一点动画过渡,多了一点极客味。但该有的提醒、该省的心,一分不少。
3.4 让Agent"记住你":一个JSON文件就够了
AI 智能体手机的另一大卖点是"越用越懂你"。我的做法很朴素:在网关服务里维护一个 memory.json,大模型每次处理完指令后,把值得记住的信息——常用地点、偏好的提醒时间、重要联系人的称呼——抽出来写进文件。下一条指令进来时,把这些记忆塞进提示词的上下文。
不搞向量数据库,也不上 embedding 服务,这点数据量用一个 JSON 文件绰绰有余。前面代码里已经预留了接口,你可以在 call_llm 时把 memory 内容一并传给模型,让它结合历史偏好做判断。想要更进阶的语义记忆,以后可以加,但那是锦上添花,不是起步必需。
到这里,一台旧手机已经完成了大部分"AI 智能体手机"发布会上的表演。剩下的问题是:它到底好用吗?
4. 同场景实测:12块方案和万元旗舰的差距比想象中小
搭完之后,我把这台"12 块版智能体手机"当主力用了半个月,期间借朋友的万元 AI 旗舰对比了几轮。直接说结论:差距存在,但没有厂商渲染的那么大。
4.1 同一批场景的横向对比
| 场景 | 12块自建方案 | 万元AI旗舰 |
|---|---|---|
| 语音设闹钟/提醒 | 体验基本一致 | 端侧处理,速度更快 |
| 跨应用发消息 | 需要二次确认 | 一键完成 |
| 日程摘要生成 | 效果好,但受费用限制 | 效果好,基本免费 |
| 主动提醒 | 靠自建触发器 | 系统级整合更顺滑 |
| 离线可用 | 不行,依赖网络 | 端侧模型可离线 |
| 长文本总结 | 偶尔用,控制成本 | 放开用 |
| 个性化记忆 | 本地 JSON,手动+自动混合 | 系统级自动学习 |
| 可定制性 | 极高,想接什么接什么 | 低,只能等厂商更新 |
| 隐私控制 | 关键数据本地存 | 大部分依赖云端 |
| 月度成本 | 12元 | 手机溢价数千元 |
必须说明的是,这里对比的是"我这套方案"和"厂商产品的公开宣传体验",不同品牌差异也很大。但大方向不会错:核心交互能力基本在同一水平线,差的是稳定性和生态密度。
4.2 便宜方案反而强的场景
先说我自认为赢得比较轻松的地方。
第一是可定制性。厂商给你预置的工具就那几个,而我的 Agent 网关只要加几行代码,就能接入任何想接的东西。前天我把家里的米家智能插座也接了进去——说一句"把客厅灯关了",网关直接通过局域网接口下发指令,灯光熄灭。这种自由度,厂商目前不会给你开放。
第二是隐私和数据掌控感。我的记忆文件存在自己设备上,重要内容随时能删,不会莫名其妙被拿去训练模型。厂商的主动服务需要数据上云,虽然方便,但扪心自问,你愿意把多少生活细节交给手机厂商?每个人答案不同,但至少我这种数据敏感型用户,自建方案更安心。
第三是成本。12 块/月,核心功能都有,剩下的钱能吃好几顿火锅。只谈核心体验的话,这笔账怎么算都不亏。
4.3 确实追不上的场景
我不玩虚的,差距最大的三个点必须讲清楚。
第一,端侧大模型的速度与离线能力。旗舰机的端侧模型可以在无网状态下完成大部分意图识别,我的方案一断网就哑火。地铁里没信号的那几分钟,体验差距是最明显的。
第二,系统级整合的稳定度。厂商的系统 AI 能直接调用日历、地图、支付等深度服务,几乎不会误触。自建方案有时要绕一大圈,碰上某个应用更新了权限策略,脚本可能就悄悄罢工。
第三,主动服务的生态密度。厂商能从你的邮件、短信、日历、地理位置里综合计算,给出更贴心的建议;我的方案只能靠手动设定好的触发器,覆盖面窄得多。比如"根据通勤实时路况提前提醒出门"这种场景,自建方案要人工适配的数据源太多,做起来很累。
所以我的定位很明确:核心体验平替,不是完全复刻。如果你追求的是"偶尔用着很爽",这套方案已经值回票价;如果你要的是"每时每刻无感流畅",那确实得靠厂商的软硬一体工程。
5. 复刻过程踩过的5个坑,每一个都折腾到半夜
搭建流程看着顺,实际操作时我踩了一堆坑。挑最典型的五个说,提前知道能省下好几个通宵。
5.1 API延迟让我差点放弃
最初网关是同步调大模型 API,一个语音指令从说话到执行,常常要等 3 到 5 秒。演示视频里这个延迟能接受,真当主力用就很急人,一度想放弃。
我后来做了三个优化。第一,该用流式输出的地方用流式,让"正在处理"的反馈先出来;第二,给常见指令做了本地缓存,比如"现在几点""明天天气"这种高频问题,直接走缓存不模型;第三,接受一个事实——自动化任务比实时对话允许慢半拍。所以我尽量把语音命令设计成"一句到位",避免来回多轮沟通。
5.2 高危操作误触,闹钟差点全没了
有次测试"帮我把明天的闹钟都关掉",结果 Tasker 把整个闹钟 App 的所有闹钟全清了。原因是我在任务分支里写得太宽,匹配到"闹钟"关键词就一股脑全关,没有做二次确认。
这件事之后我立了一个规矩:AI 可以包办,但不能越权包办。凡是涉及删除、发送、支付等级别的操作,一律在高危动作前加确认弹窗,或者要求指令里必须包含明确的"确认"关键词。自动化执行和高危操作之间,必须永远留一个人类确认的闸门,这是底线。
5.3 第一个月账单超了预算
我以为自己用量很低,结果第一个月账单下来 30 多块,比预期翻了一倍多。查了一下用量明细,原因有两处:某几天连续跑了很多长文本总结;另一些请求把超长历史记录全塞进了上下文,token 消耗巨大。
对症下药后,我把上下文做了截断处理:超过 2000 token 的历史直接归档,日常只加载最近几条;同时对 API 设置了月度额度预警,超过 80% 就通知我。账单慢慢回落到了 12 块附近。这个坑必须警惕:模型本身的单价已经很低,贵的是无节制的上下文堆积和放飞的调用量。
5.4 语音入口接得稀碎
自定义语音指令最大的坑是:系统自带语音助手的识别率还行,但对第三方自定义触发词的支持极不稳定。我折腾了两天,发现最优解不是硬刚语音助手,而是换一个交互方式——在桌面放一个小部件,点一下就能录音并转文字发到网关,识别率比语音助手的自定义短语高得多。
对于"不想动手"的场景,再保留语音触发词双管齐下。这个经历让我明白:交互从来不是只有一条路,灵活组合最重要,没必要死磕某一个入口。
5.5 后台被杀、权限被回收
自建方案的另一个大敌是安卓后台回收机制。自动化工具、本地小服务,动不动就被系统进程回收,我已经不止一次发现闹钟没设上,就是因为 Tasker 在后台被杀了。
解决方案是:把关键工具加入电池优化白名单、锁定后台任务,部分机型还要在权限设置里允许自启动。如果你是 iOS 用户,后台限制更严,建议把需要稳定运行的服务放在家里的小主机上,手机只当"遥控器",这样反而更稳。我的最终状态就是这样:网关和记忆文件都在家里的小主机上,手机通过局域网或远程访问,很少再出幺蛾子。
这五个坑,只要提前知道,几乎都能绕开,但一个个踩过去确实很耗时间。好在踩完之后的稳定性还是很让人满意的。
6. 拿12块方案先跑两周,再决定要不要花上万
文章最后,聊聊那 36 万人到底该不该抢的问题。我的答案比较折中:先搞清楚自己属于哪一类人。
6.1 四种人,直接买AI智能体手机更合适
如果你属于下面几类,建议不要折腾自建方案,直接买厂商的 AI 智能体手机更省心:
- 完全不想折腾技术的人。宁可多花钱,也要开箱即用,稳定优先。
- 重度日程和商务人士。系统级整合的日历、邮件、会议摘要体验,确实值那个溢价。
- 长辈用户。语音交互门槛低,厂商的端侧模型和主动服务更可靠,出问题有售后。
- 很看重离线能力的人。经常出入无信号环境,端侧推理是刚需。
6.2 另一种情况:我的方案可能更适合你
如果你的情况符合下面任何一条,我强烈建议先别急着掏钱:
- 你本来就爱折腾数码和自动化,家里有闲置电脑或手机;
- 你对"手机厂商掌握全部数据"这件事很敏感;
- 你只是被某两三个 AI 场景吸引,并不需要全系统 AI 覆盖;
- 你预算有限,但不想放弃智能体功能。
这四种情况下,12 块/月方案会给你 90% 的体验,外加 10% 的折腾成本。而对于爱玩的人来说,这 10% 的折腾本身就是乐趣。
6.3 我的最终建议:先试再买
如果你正在纠结要不要冲那台 36 万人抢的手机,我建议先别冲。用这套 12 块的方案跑两周,搞清楚"AI 智能体手机"在你生活里到底扮演什么角色。跑完你会得到两个结果:要么发现你需要的就是一个会设闹钟、查天气、记备忘的语音助手,那 12 块方案绰绰有余;要么你确实对系统的流畅整合、离线响应、生态联动产生了刚需,那到时候再买也不迟,而且选择会理性得多。
我常跟朋友说的一句话是:新技术的价格里总是含着不少"想象力溢价"。自己动手做一遍,既是把这笔溢价省下来,也是把对技术的理解真正握回自己手里。这和省不省钱无关,纯粹是折腾的乐趣,顺带还能在日常使用中收获一种"这手机是真的懂我"的实在感。