☰
ModLens 从安装到第一次识图
2026/10/3 6:13:12 网站建设 项目流程

DeepSeek 的主力对话模型和 GLM-5.3 本体仍是纯文本,直接粘贴一张截图不会有任何反应。ModLens(liustack/modlens)就是补上这一段:给纯文本模型外挂视觉引擎,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。站点把它归在dsh 原生插件 · vision,信任档位「已验证」,本站已于 4 天前真实安装成功。npm 包为@liustack/modlens,版本 3.26.5,MIT 许可。

这篇是纯步骤教程,从确认环境走到跑通第一次识图,命令可直接照抄。

第一步:确认 Node 版本

Node 引擎要求>=22.19(基线 Node 22.19 满足):

低于 22.19 先升级 Node,再往下走。

第二步:装好 dsh CLI

插件跑在 dsh 之上,引擎得先有:

第三步:一条命令装插件

dsh 用户不走 skill 流程,本包就是原生 dsh 插件:

README 另给了钉死版本 3.26.5 的写法:

npm 包发布者账号已校验与本仓库一致,走 npm 安装最省事。装完即有modlens_read_image工具。想顺手横向对照同类插件的中文清单与安装形态,见 完整插件清单与汉化避坑指南。

第四步:选一个视觉引擎

插件本身不产出视觉能力,必须配好任一内置 provider(或授权复用本机 CLI)才有结果。视觉来源一共十个:六个内置 provider,加四家可复用 CLI。起步两条路。

路径 A:免费 Gemini key(推荐默认)。到 Google AI Studio 领取,约三分钟、无需信用卡,配上后每次识别 5 到 10 秒,是免费方案里最快的一条。

路径 B:Antigravity CLI(完全免注册)。不用 key,浏览器登录一次即可:

浏览器完成登录后退出。代价是单次识别 15–45 秒,比 API 快车道慢数倍。

先体检,再决定配不配 key。安装会先盘点机器上已有的东西,Claude Code、Codex、OpenCode 或 Pi 里任何一个已有登录态都可能就够了:

体检会逐个发现可复用的 CLI 并询问是否允许复用。复用前一定先征得同意,不授权=不启用;获准的登录态与你自己的 key 平级入链、不插队。只在体检两手空空时才需要配免费引擎。

接任意 OpenAI 兼容端点。openai是万能接口,任何讲 OpenAI chat-completions 协议、支持图片输入的端点都能插上,以通义千问视觉模型为例:

同样三个键,换成 GLM 开放平台、SiliconFlow、OpenRouter 或自建网关都一样。apiKey也接受英文逗号分隔的列表:鉴权、限流或配额失败会轮换下一个密钥。

第五步:跑通第一次粘贴识图

装好之后不需要记命令:正常聊天,粘贴图片或给出图片路径、提问即可,skill 自动触发。dsh 里有两种粘贴玩法。

玩法一:直接粘贴。贴进来的图片自主转换成文件路径进输入框(与 OpenCode、Pi 同款交互),modlens_read_image工具接手读图。

玩法二:切到带(modlens vision)后缀的模型变体再粘贴。选择器有记忆,选一次就行;缩略图直接可见、所见即所得。变体由插件自动发现生成:每条承载纯文本 DeepSeek 或 GLM 模型的 provider 路由各得一组包装条目,默认安装下就是DeepSeek-V4-Flash (modlens vision)与DeepSeek-V4-Pro (modlens vision)。

第六步:批量图片与追问同一张图

一次粘贴多张。实测里一次粘贴三张图,模型逐张读取,认出三张同属一个视觉家族,并分别描述每张插画。密集图表是视觉方案最容易出错的场景,实测的 128 个模型对比散点图被完整读出双轴、对数刻度与高亮区域。

追问同一张图不用再贴。回答基于证据而非想象:全文转录、按阅读顺序划分的版面区块、实体与关系列表,模型引用的是具体内容。要快捷键把屏幕截进 DeepSeek Harness 时,另装独立插件 dsh-screenshot。

觉得慢或觉得贵,先查两个字段。meta.attempts记录每次尝试,meta.warnings标明这次复用花的是谁的额度,回退永远不是无声的。

安装与卸载注意

旧版 dsh 上找不到配置卡片。dsh 0.1.7 起才把插件配置挪到侧栏的「插件」页,在「已安装」里点开@liustack/modlens就能切换引擎、勾选 auto 模式复用哪些本机 CLI,点几下保存即生效。更早版本的入口位置不同,按上面的 CLI 命令走即可。

卸载没有专门的子命令。它不用 hook、不套壳、不跑本地代理进程、不改任何 harness 配置的一行字:在 skill 类 harness 里是一个 skill 文件夹,在 dsh 里就是一个插件。卸载等于删掉那个文件夹,agent 立刻回到原样。

想提 PR 改代码会被挡。本仓库不接受 PR,项目由作者独立维护。有效参与方式是提 issue(bug、建议、报错或文档都欢迎,会被认真阅读并影响开发方向)和 Fork(MIT 下副本完全归你)。

总结

从确认 Node 版本到粘贴第一张图,成本主要落在一次引擎配置,配好之后日常就是「贴图、提问」两步;想对照同类插件的中文清单与安装形态见 完整插件清单与汉化避坑指南

适合与不适合

适合:主力模型是纯文本 DeepSeek 或 GLM、常要读截图和图表的人;手上有 Claude Code、Codex、OpenCode、Pi 登录态、想直接复用的机器;愿意接受 15–45 秒等待换零注册起步的试用者;要把识图结果接进下游工具、需要结构化 JSON 的开发者。

不适合:本机没有任何可用视觉引擎、又不打算配 key 或登录 CLI 的场景,它此时什么都读不了;对延迟敏感且不接受 CLI 兜底 15–45 秒的场景;需要保证图片不出本机的场景,粘贴即等于把图片交给第三方视觉服务;以及指望提 PR 让上游合并改动的团队。

标签:ModLens、DeepSeek Harness、视觉插件安装教程、粘贴识图、dsh 插件

本文由 DeepSeek Harness Hub 自动整理,数据来源于插件详情页。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询