DeepSeek Harness 桌面版实测:Agent 的"壳"开箱即用了,我拿到手先玩了这四件事
四天前我写了篇《中秋节 DeepSeek 偷跑桌面版》,当时口径很诚实:还没实机跑。
昨天(9 月 29 日)晚上,官方直接把"还没跑"这三个字抹掉了——DeepSeek Harness v0.2 预览版正式发布,macOS 和 Windows 桌面端安装包开箱即用,官网deepseek.com/harness下载,装完跟随引导就能干活。注意版本号:从我上次见的 v0.1.7-rc.2 一步跳到 v0.2,节奏相当快。
这篇就是那篇"前瞻"欠下的实测下篇。我拿到手先玩了四件事:装它、让它干活、给它装插件、让它给自己造插件。凡是截图的地方我都留了位,凡是官方没说、我实测看到的地方,我会写清楚是实测口径还是推断。
一、开箱:三分钟从下载到登录
先说结论:这次"开箱即用"不是营销话术,是真把命令行门槛拆了。
上一版你要先在终端敲npx @deepseek-ai/dsh web起本地 WebUI,对非开发者劝退率极高。v0.2 的桌面端就是一个普通的双击安装的 App,全程不碰终端。
装完第一次打开,跟着引导走:给个名字、指一个本地工作区(它所有读写都发生在这个目录里,建议单独建一个空文件夹,别直接指到你的主目录)、登录 DeepSeek 账号。
有个羊毛值得提一句:官方这轮活动,符合条件的用户使用 DeepSeek 账号登录桌面端,限时送 6 元体验赠金(到账后 7 天内有效,限量)。6 元听起来不多,官方给的换算口径是约 1.2 亿缓存命中输入 token——对于"想试试但不想先充钱"的人来说,这笔账够用很久。
二、第一件实测的事:扔给它一份乱七八糟的表格
官方对 v0.2 的定位很明确:面向日常办公和开发。文档、表格、PDF 丢进去,让它整理资料、分析数据、生成图表、做演示文稿;也能改项目、跑代码。
我选了最能体现"日常办公"的场景:一份格式混乱的销售明细表——自制素材(65 行,藏在华宸贸易-2026年销售明细-原始版.xlsx),经典脏表五件套全齐:日期 6 种写法混用、金额有的带"¥"有的带"元"还有千分位逗号、同一区域四种叫法(华东/华东区/沪区/East)、区域列手工竖向合并单元格、外加 3 行重复、2 行退款负数和 2 处空数量。会计和运营看到会血压升高的那种。
关键一步:我提前用脚本把正确答案算好存了一份核对基线(净销售额 344,720 元、有效记录 62 行、分区域明细都在华宸贸易-2026年销售-核对基线.xlsx)。测 Agent 处理表格,最忌"看着像对了"——有基线在手,它每一步清洗结果我能逐条对答案,这才叫实测。
(注:表中"华宸贸易"及全部人名、商品、金额均为脚本生成的虚构数据,仅用于演示。)
指令就一句人话:“清洗这份表格:统一日期与区域名称,按订单号去重,退款计为负数;按月份汇总各区域销售额,生成一张月度对比图,再把结论做成不超过 5 页的 PPT。保留一张’被剔除问题行’的清单。”
v0.2 这次更新里我最认可的一个细节:生成的文件和每轮代码变更会集中展示在对话里,侧栏可以直接预览文件内容、查看代码 diff,还能用本地应用打开继续编辑。
为什么这个细节重要?很多 Agent 产品的交付是"聊天框里一段文字描述它干了什么",你要自己去文件系统里找它到底改了什么。Harness 把**"说了什么"和"做了什么"分成两层展示**——对话流负责叙述,diff 面板负责证据。对拿不准要不要信任 AI 改动的场景(改代码、改报表),这个设计直接决定了你敢不敢放手用。
整个过程耗时5分23秒,一轮搞定,生成效果也相当不错:
三、第二件实测的事:定时任务——把"每天要干的活"外包出去
v0.2 内置了一个自动化任务插件,在侧栏插件管理页开启后,可以把重复性工作设为按计划执行的定时任务,支持查看运行记录、调整执行频率与任务指令。
这个功能信息量很大,先补一句原理:Agent 产品做到今天,“你说一句它干一票"已经不是卖点了,"你不在场它也能把例行动干完"才是。定时任务就是把 Agent 从"问答工具"变成"值班的员工”。Claude Code 社区要靠外部 cron + 脚本人肉攒出来的东西,Harness 直接做成了开关。
我设了一个每天下班前跑的任务:“扫描工作区里当天新增的文件,汇总成一份清单 Markdown,标注哪些疑似重复。”
四、第三件实测的事:装第三方插件,现在真的不用碰命令行
"一切皆插件"是 Harness 从开源那天就喊出来的设计理念——小到一把工具,大到整个交互界面,都能以插件方式融入。上篇我泼过冷水:理念很好,但装插件还得命令行,生态就是空中楼阁。
v0.2 新增的插件管理页面把这个窟窿堵上了一半:输入插件的 npm 包名即可安装,不用打开终端;同一页面能停用、卸载、查看插件介绍与来源。
这里展开讲一下"为什么 npm 包名"这个选择值得说:Harness 本体是 TypeScript 写的开源运行时,插件直接用 npm 分发,等于把全球最大的包生态变成自己的潜在插件市场。一个开发者把自己今天写的小工具发到 npm,明天 Harness 用户就能在桌面端贴个包名装上——这个分发链路比"官方审核上架应用商店"轻太多,也野太多。
官方还给了个佐证数据:按官方模型 API 用户口径,约 60% 的 DeepSeek Harness 用户使用了第三方插件——"一切皆插件"已经不只是口号了。
我装的第一个插件选的是ModLens(npm 包名@liustack/modlens,MIT 开源,GitHub 约 4k stars)——它是 DSH 生态里的"第一个视觉插件",解决的痛点一句话能说清:DeepSeek 旗舰模型是纯文本的,装之前你往对话框里贴截图,它只会跟你要文件路径;装之后贴图就能直接读。给壳装眼睛,这个演示比装任何效率工具都有戏剧性。
安装搜索时必须是完整 scoped 名@liustack/modlens,@和/一个不能少。最开始我输入的是modlens,提示"未找到"。
模型选择器里能看到DeepSeek (modlens vision)和DeepSeek-V4-Pro (modlens vision)两个条目——说明插件加载成功了
五、第四件实测的事:创造模式,让 Agent 给自己造器官
这是我从上篇就惦记着要测的:创造模式(标注实验性)下,你可以通过对话描述需求,让 Harness 编写和修改插件。创建的插件即时生效、持久保存,并出现在插件管理页面。
注意这句话里的递归结构:一个 Agent,正在修改承载它自己的壳。插件系统属于壳,壳里的 Agent 又有权扩展壳——"一切皆插件"在这个瞬间才真正成立,因为你连"能力边界"这一层本身都变成了可插拔件。
我给自己出的题很克制(毕竟是实验性功能):让它造一个"工作区字数统计"小插件——统计当前工作区所有 Markdown 文件的总字数,作为一个可以在对话里调用的工具。
个功能真正的产品意义不在于"每个人都需要自己写插件",而在于它把定制成本打到了"会说话就会"的量级。你觉得工具缺个什么小能力,描述一下,它自己长出来。精装房没有这个自由度,乐高有。
六、把五个"壳"放在一张桌子上
看完自己玩的部分,回答那个绕不开的问题:这东西和 Claude Code、WorkBuddy、Trae、Qoder 们是什么关系。
先声明口径:这是定位对比,不是跑分横评——各家产品形态差异太大,同题 PK 需要一套很重的评测设计,改天的事。下表基于各产品公开资料与我的上手印象:
| 维度 | DeepSeek Harness | Claude Code | WorkBuddy | Trae | Qoder |
|---|---|---|---|---|---|
| 本质 | Agent运行时+ 桌面壳 | 编程 Agent(CLI 为核) | AI 工作台(办公向 Agent) | AI IDE | AI 编程平台 |
| 开源 | MIT,可自改自建 | 闭源 | 闭源 | 主体闭源 | 闭源 |
| 主场 | 桌面 GUI,办公+开发通吃 | 终端/IDE,纯开发 | 办公协作、技能生态 | 写代码(集成 IDE) | 写代码(规格驱动) |
| 扩展 | 一切皆插件(npm 直装)+ Agent 自造插件 | MCP 生态 | 技能(Skills)+ 连接器 | 内置能力迭代 | 内置能力迭代 |
| 模型 | DeepSeek 系(自家 API 计费) | Anthropic 系 | 混元等多模型 | 豆包系等 | 千问系等 |
| 给谁 | 不想开终端的泛工作者 + 想拆壳的开发者 | 终端不离手的开发者 | 用办公流吃饭的人 | 开发者 | 开发者 |
几个判断:
第一,假想敌看错方向是常见的评测病。Harness 桌面版抢的不是 Cursor/Trae/Qoder 的编程份额——那些产品背后是开发者"IDE 长在身上"的肌肉记忆。它抢的是"听说了 Claude Code 很神但装不上手"的泛知识工作者:装 App 谁不会?指个文件夹谁不会?说人话派活谁不会?三个"谁不会"就是它的普惠刀法。
第二,开源壳是它唯一不可复制的身份。WorkBuddy、Claude Code 再强,你用的都是别人调教好的黑盒。Harness 这层壳是 MIT 的,企业可以把调度逻辑、权限策略、数据存储全部拆开重做——对"数据不能出域"的场景,这一条就够进选型名单了。当然,壳开源不等于体验开源,私有调教的那部分未必在仓库里,这是我上篇就提过的疑点,至今仍是疑点。
第三,"Agent 自造插件"目前只有它端上桌。各家都有 MCP/技能/连接器生态,但生态都是"人给 Agent 装手";创造模式是"Agent 给自己装手"。哪怕现在还实验、还粗糙,方向上是个独苗。
七、还是那三盆冷水(v0.2 泼哪些)
热点文不写局限就是软文。更新到 v0.2,冷水的点位变了,但还是有:
- 官方自己仍在说"尚未成熟"。发布稿原话:“尚在起步阶段,功能与体验仍有待细致打磨”,创造模式明确标注实验性。v0.2 依然是 preview,把重要资料交给它批量操作之前,先备份——这句不是我说的,是官方文档建议。
- 定时任务和插件权限是安全面。一个会按计划自主执行、还能装任意 npm 包的 Agent,等于你给一个实习生开了永久门禁 + 自带工具箱。工作区目录要选对,插件包名要认得来路,这两条纪律不能松。
- 生态数据要换个角度看。"60% 用户用第三方插件"同时说明另一件事:官方内置能力还盖不住用户的主要需求。插件市场、插件 API 稳定性(官方承诺将来减少破坏性更新)都还在路上——乐高给了你,好拼的积木还在生产中。
八、收尾:壳战争才刚开始
把这次实测浓缩成一句话:DeepSeek 正在把"Agent 产品"的定义权,从"谁的模型强"挪到"谁的壳好用、谁的壳开源"。
发布稿里那句"日均活跃用户、日均会话数口径下,Harness 已成为最受 DeepSeek API 用户欢迎的 Coding Agent",以及"与模型共同进化——在模型训练中优化 Harness 中的表现",这才是值得警觉的信号:模型和壳的耦合在加深。当年"套壳还是原生"的讨论,正在变成"壳本身就是产品护城河"的现实。
至于路线图上那些名字——沙箱与安全、长期记忆、浏览器和 GUI 自动化、远程与移动端、官方插件市场——每一个都对应今天版本的一块短板。它没有吹自己做好了什么,它把没做好的事按优先级列了出来。这种发布节奏,比功能清单本身更像一支想清楚了的产品团队。