如何 10 分钟上手 Handy:离线语音转文字新手实操指南
【免费下载链接】HandyA free, open source, and extensible speech-to-text application that works completely offline.项目地址: https://gitcode.com/GitHub_Trending/handy11/Handy
Handy 是一款免费、开源的跨平台语音转文字应用:按住快捷键说话,松开后文字直接插入当前光标位置。它最大的特点是完全离线——录音、识别、粘贴全部在本机完成,语音不会上传到任何云端服务,支持 Windows、macOS 和 Linux 三个平台。
在 macOS、Windows、Linux 上安装并启动 Handy
- macOS:在终端运行
brew install --cask handy,通过 Homebrew 完成安装。 - Windows:运行
winget install cjpais.Handy,由 Microsoft 包管理器下载安装包。 - Linux(Debian/Ubuntu):先从官方发布页下载
.deb文件,再运行sudo apt install ./Handy_*.deb,让 APT 自动补齐依赖;不要用dpkg -i直接装,会缺依赖。
注意 Homebrew cask 和 winget 包都是社区维护的,并非 Handy 开发团队自己维护。
安装后首次启动,按提示授予两项系统权限:麦克风权限用于录音,辅助功能权限用于把转写结果写入其他应用。缺了任何一项,后面都会卡住。
设置录音快捷键,完成第一次转写
打开设置,最核心的一项是快捷键和它的触发方式。Shortcut Behavior 有三个选项:
- Auto:按住快捷键录音、松开停止,轻点一下则切换录音开关,两种习惯都兼容,适合大多数人。
- Hold:只在按住期间录音,松开立即结束,适合短语句速记。
- Toggle:按一次开始、再按一次结束,适合长段落口述。
选好模型后第一次录音时,Handy 会自动下载识别模型。录音过程中,支持流式识别的模型会在屏幕角落的悬浮层里实时显示正在转写的文字,边说边看,不用盲等:
整个流程是:Silero VAD 先过滤掉沉默段,识别模型输出文本,Handy 再把文本粘贴进你当前正在用的应用(备忘录、浏览器、编辑器都行)。
按语言和硬件选择合适的语音识别模型
设置 → Models 里可以下载和切换模型,每个模型都提供从 Q4 到 F32 的多种量化版本,精度和体积各取所需。选模型就回答两个问题:说什么语言、机器强不强。
- Parakeet Unified EN 0.6B:英文场景默认推荐,支持流式识别,Q8_0 版本约 731 MB,速度快。
- Nemotron Streaming 3.5:覆盖 28 种语言,支持流式识别和自动语言检测,适合中英混说等环境。
- Canary 180M Flash:只有 4 种语言(英、德、西、法),Q4 版本约 140 MB,低配置电脑也能跑得流畅。
- Cohere Transcribe:14 种语言,目录中精度分最高,但速度最慢,Q4 版本约 1.5 GB,需要较好的硬件。
- Whisper 系列(Small/Medium/Turbo/Large):语言覆盖最广,Medium 支持 99 种语言并可翻译为英文,有 GPU 时会自动加速。
经验法则:只说英文选 Parakeet,多语言选 Nemotron,老机器选 Canary,追求极限精度选 Cohere 或 Whisper Turbo。
调高识别准确率的三个设置项
- 自定义词汇:把专业术语、人名、产品名加进自定义词汇表,识别引擎会优先匹配这些词,能明显减少专有名词的错字。
- 后处理:可选功能,接入一个 LLM(需填 API Key)对转写结果二次整理,比如清理口头禅、修正标点;不填就保持关闭,功能默认离线。
- 历史记录:转写记录保存在本地,可设置保留期限和条数上限,方便回看或删除旧记录。
这些选项都在设置窗口里,对应代码位于 src/components/settings/,想弄清某个开关的具体行为可以对照阅读。
解决 Linux 常见问题和模型下载失败
Linux 下文字粘贴不进去:Handy 依赖系统工具把文本写入其他应用,Wayland 用户先装sudo apt install wtype,X11 用户装sudo apt install xdotool。
启动时报libgtk-layer-shell.so.0缺失:装运行时库,Debian/Ubuntu 执行sudo apt install libgtk-layer-shell0。
窗口渲染异常或崩溃:用WEBKIT_DISABLE_DMABUF_RENDERER=1 handy启动试试,有效的话把该变量写进启动方式里长期生效。
转写文本粘贴到了错误窗口:某些 Linux 合成器下录音悬浮层会抢占焦点,进 设置 → Advanced,把 Overlay Position 设为 None 关闭悬浮层即可。
网络受限导致模型下载失败:打开设置 → About 复制 App Data Directory 路径,在里面建一个models文件夹,把模型文件(Whisper 的.bin或.gguf文件)原样放进去,重启 Handy,Models 页面就会显示为已下载。
另外,在设置窗口按Ctrl+Shift+D(macOS 为Cmd+Shift+D)可以打开 Debug 面板,剪贴板恢复延迟等进阶选项都在那里。想自己从源码构建,参考 BUILD.md 中的分平台说明。
如果你的工作经常需要长时间口述、处理敏感内容,或者要在断网环境里打字,Handy 基本没有替代品;对只偶尔用一次语音输入的普通用户,它的模型下载体积(几百 MB 起步)需要先权衡磁盘空间。下一步建议从默认的 Auto 快捷键和 Parakeet 模型跑起来,用一两天后按自己的语言习惯再换模型和调词汇表。
【免费下载链接】HandyA free, open source, and extensible speech-to-text application that works completely offline.项目地址: https://gitcode.com/GitHub_Trending/handy11/Handy
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考