Pot 划词翻译与 OCR 软件完整上手指南
【免费下载链接】pot-desktop🌈一个跨平台的划词翻译和OCR软件 | A cross-platform software for text translation and recognition.项目地址: https://gitcode.com/GitHub_Trending/po/pot-desktop
读英文论文遇到一连串生词,或屏幕上有一段报错选不中、想把文字抠出来时,复制粘贴到网页翻译框来回切换很拖节奏。Pot 划词翻译与 OCR 软件把两步压成一步:选中文字按快捷键直接弹译文,截图框选区域直接出识别文本。本文按装好、跑通、配好、集成四步讲完,覆盖 Windows、macOS、Linux 三大平台。
🚀 安装 Pot 并完成首次启动
三个平台都有现成包管理器,每个系统只给一条最快命令。
Windows
PowerShell 中执行:
winget install Pylogmon.pot装完在开始菜单找到 Pot 图标启动,系统托盘出现图标即正常。
macOS
终端执行(tap 和安装合并成一行):
brew tap pot-app/homebrew-tap && brew install --cask pot首次打开若提示"由于开发者无法验证",去 设置 → 隐私与安全性 点"仍要打开",以后就不再弹。
Linux
跨发行版最省事的是 Flatpak:
flatpak install flathub com.pot_app.pot启动后托盘出现图标即成功。注意 Flatpak 版目前缺失托盘图标,介意的话改装 deb 包(sudo apt-get install本地 deb 文件)或 AUR 的pot-translation。
首次启动必做三件事
- 进 偏好设置 → 快捷键,给划词翻译、输入翻译、截图 OCR、截图翻译四项分别绑定组合键——出厂时这四项是空的,不设置就不会触发。
- 在 偏好设置 → 服务设置 里添加至少一个翻译服务,选 Google、Bing 这类免密钥的即可先跑通。
- 确认识别服务:Windows 和 macOS 的系统 OCR 本身就离线,Linux 走 Tesseract,不用额外申请。
🎯 实操三大核心功能:划词、输入与截图 OCR
三个功能都是"快捷键 → 出结果",区别只在输入来源:选中的文本、手动输入的文本、屏幕截图。
划词翻译:选中即出译文
- 场景:阅读外文文档,鼠标选中一句话。
- 操作:选中后按一下你为划词翻译绑定的快捷键,建议避开纯复制类组合,减少误触发。
- 结果:译文面板在选中位置附近弹出,配置了多个引擎时结果并排显示,可逐条对比。
顺带一个提效技巧:在任意翻译面板左上角点图标开启剪切板监听模式,之后只要复制文字,不用选中、不用按键,面板自动翻译。连续查阅大量词条时比逐次按快捷键省力。
划词适合短句,遇到整段、整篇就换输入翻译。
输入翻译:大段文本走这里
- 场景:要把一封英文邮件转成中文再回复。
- 操作:按输入翻译快捷键呼出窗口 → 粘贴或输入文本 → 按回车。
- 结果:译文直接落在面板里,可复制,也可顺手存进历史。
文字在图片里、选不中时,就轮到截图 OCR。
截图 OCR:选不中的文字框出来
- 场景:PDF 扫描页、视频截图里的文字无法用鼠标选中。
- 操作:按截图 OCR 快捷键 → 框选目标区域。
- 结果:识别文本出现在识别面板,可继续复制或直接接着翻译。精度主要取决于截图清晰度和语言设置,模糊小字和斜体是重灾区。
截图 OCR 跑顺后,还可以给"截图翻译"单独绑一个键,框完直接出译文,省掉一步。
⚙️ 按使用目标配置翻译与识别服务
服务别追求"装全",按你要达到的效果分组选。
追求开箱即用、不申请密钥
翻译选内置的 Google、Bing、Lingva,添加即用;识别用系统 OCR(Windows 走 Windows.Media.OCR,macOS 走 Vision,Linux 走 Tesseract),全程离线。日常查词、看文档这一档够用。
要求离线与隐私
翻译走 Ollama:本地装好 Ollama 并拉一个多语言模型,Pot 里添加 Ollama 服务指向本机,文本不出机器;想要更轻可以装 ECDICT 离线词典插件。识别侧用 Tesseract.js 离线方案或 Rapid 离线插件,不依赖任何在线服务。
追求识别精度
在线识别服务(百度、腾讯、火山、讯飞)在复杂版面上明显好于纯本地引擎,代价是申请密钥。公式图片单独用 Simple LaTeX 接口,普通 OCR 对手写公式基本失效。
追求翻译质量
长句和专业文档换 DeepL,或 OpenAI、智谱、Gemini 这类大模型接口,上下文理解更好;百度、腾讯、阿里、有道等商业接口术语库更稳。这些都需先在对应平台申请密钥再填入。内置服务实现分别在 src/services/translate/ 和 src/services/recognize/,想看某个接口怎么调的可以直接翻源码。
| 方案 | 翻译服务 | 识别服务 | 是否需要密钥 |
|---|---|---|---|
| 免配置直连 | Google / Lingva | 系统 OCR | 否 |
| 全离线隐私 | Ollama / ECDICT | Tesseract.js / Rapid | 否 |
| 高精度识别 | 百度 / 腾讯 | 百度 / 腾讯 / 火山 | 是 |
| 大模型质量 | DeepL / OpenAI | 按需选在线 | 是 |
🔌 用 HTTP 接口把 Pot 接入自动化
Pot 内置一个只监听本机127.0.0.1的 HTTP 服务,端口默认60828,可在设置里改。主要端点:/selection_translate(划词翻译)、/input_translate(输入翻译)、/ocr_recognize(截图 OCR)、/ocr_translate(截图翻译)、/translate(POST,body 为待译文本)、/config(打开设置窗口)。想用自己的脚本或截图工具触发,直接请求即可:
curl "127.0.0.1:60828/selection_translate" curl "127.0.0.1:60828/ocr_translate"两个实用点:
- 不想用内置截图时,把截图存到
$CACHE/com.pot-app.desktop/pot_screenshot_cut.png,再请求/ocr_recognize?screenshot=false,Pot 会读这张图识别。Linux 上可借此接 Flameshot,或在 Hyprland 里用 grim + slurp 配一条系统快捷键。 - Windows 可给 SnipDo 装 pot 扩展(pot.pbar),macOS 可给 PopClip 装 pot 扩展(pot.popclipextz),选中文字后在第三方工具条里点一下就能翻译,不用记快捷键。
内置接口不够时走插件系统:下载.potext文件后,在 偏好设置 → 服务设置 → 添加外部插件 里安装,装完和内置服务一样用。Lingva、Tatoeba、OCRSpace、Rapid 其实都是插件。有定制需求可以从官方插件模板起步开发自己的服务。
❓ 速查常见问题
启动后没有界面,托盘点了没反应
Windows结论先说:大概率是 WebView2 缺失。检查是否卸载或禁用了 WebView2,装回来即可;企业系统装不了就改用 Release 里带fix_webview2_runtime的内置版安装包。
快捷键按了没反应
macOS去 设置 → 隐私与安全 → 辅助功能,把 Pot 移除后重新添加,权限会刷新。Linux应用内快捷键在 Wayland 下不支持,改用系统级快捷键执行 curl 请求触发;X11 下则先排查组合键是否与其他软件冲突。
翻译请求失败
先查 API 密钥和字段是否填对,再查网络;免密钥接口(Google、Bing)失败多半是网络或代理问题。若弹出 "Server start failed" 通知,是默认端口 60828 被占用,进设置把端口改掉再重启。
OCR 识别不准
结论:先保证截图清晰、对比度足够,再确认识别服务的目标语言设置正确。特殊字体、公式、手写体换对应服务(公式用 Simple LaTeX),在线服务精度通常高于本地引擎。
核心操作就三个:选词按划词键、大段用输入翻译、图片文字走截图 OCR。下一步建议:先只配一个免密钥翻译服务把划词跑通,再按真实使用场景加离线或在线服务,别一次装全。
【免费下载链接】pot-desktop🌈一个跨平台的划词翻译和OCR软件 | A cross-platform software for text translation and recognition.项目地址: https://gitcode.com/GitHub_Trending/po/pot-desktop
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考