Buzz:完全离线的语音转文字工具,本地 Whisper 转录三步上手
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
周五晚上,三小时的访谈录音还躺在桌面文件夹里。两小时后,一份带时间戳的文字稿出现在导出目录,连每段话对应谁说的都标好了——这是 Buzz 在你笔记本上跑出来的结果,全程没有任何一秒音频被上传。
一句话定位:跑在本地电脑里的离线语音转文字
Buzz 是一款开源免费的桌面应用,把 OpenAI Whisper 搬到本地运行:转写或翻译音频、视频文件,也能处理 YouTube 链接和麦克风实时录音,转完还能在查看器里搜索、编辑、同步播放,再导出成你需要的格式。
- 协议:MIT
- 运行:完全离线,音频不离开本机
- 平台:Windows / macOS / Linux / PyPI
- 模型:Whisper 五档 + 4 种推理后端
- 语言:约 99 种,MMS 可及上千种
工作原理:本地 Whisper 怎么把音频变文字
链路很直接:导入的媒体先经 ffmpeg 转成 16kHz 单声道,喂给本机模型做推理,输出带起止时间的文本段落,再导出成最终格式。模型文件下载一次就缓存在本地(Linux 在~/.cache/Buzz),之后的转写不需要网络。
模型分 tiny、base、small、medium、large 五档外加 turbo:tiny 快但错得多,large 最准但吃硬件,日常用 medium 或 small 通常够用。后端也有四种:NVIDIA 显卡且显存 6GB 以上选 Faster Whisper;其他显卡或纯 CPU(包括 Mac)选 Whisper.cpp,走 Vulkan 加速。
落地三步:离线安装 Buzz 到拿到第一批文字
三个平台的安装差异:
| 平台 | 安装方式 |
|---|---|
| Windows | 官方安装包,未签名,选"更多信息 → 仍要运行" |
| macOS | 下载.dmg拖进应用程序 |
| Linux | flatpak install flathub io.github.chidiwilliams.Buzz或sudo snap install buzz |
Python 用户也可以:
pip install buzz-captions python -m buzz需 Python 3.12 环境,并先装好 ffmpeg。
首次使用:点左上角+导入文件,选好模型档位、语言、任务(转写或翻译成你的语言),点运行。完成后双击任务行打开转录查看器——能搜索、逐句编辑、播放与文字联动,最后导出 TXT、SRT 或 VTT 三种格式。
三个真实工作流:访谈、字幕与多语言
如果是记者:把两小时访谈变文字稿
采访结束的当晚是黄金整理期,而 Buzz 的查看器就是为此设计的。
- medium 档换准确率,语言手动指定
- 播放到哪儿,光标跟到哪儿
- TXT 给文字稿,SRT 留给后期
🎬 如果是视频创作者:把录音变成 SRT 字幕
Buzz 可以直接导入 MP4,自动提取音轨转写,产出的字幕还能二次整理。
- 用"调整大小"合并过短字幕条
- 长句按标点拆成多条
- 导出 SRT / VTT 拖进剪辑软件
如果是多语言资料:直接翻译成目标语言
面对外语讲座、会议录像,把任务从"转写"切成"翻译",Buzz 会直接产出你指定的目标语言文本,和原声一样带时间戳。冷门语种可以换模型解决:MMS 家族覆盖上千种语言,在模型偏好里按需下载即可。
进阶玩法:实时转录、文件夹监视、说话人识别
实时转录:麦克风边说边出字,"追加并校正"模式还会回改上一句的错字。开启实时导出后,文字实时写进一个 txt 文件,可直接喂给 OBS 做直播字幕。
文件夹监视:指一个输入目录和输出位置,新音频丢进去自动转写并导出,会议录音落地就出纪要,不用人守。
说话人识别:多人对话自动区分说话人并打上标签,导出文本里"谁在什么时候说了什么"一目了然。
其余一句话带过:嘈杂录音可先做语音分离降噪、支持导入 YouTube 链接、快捷键全可自定义、导出文件名支持{{ input_file_name }}模板变量、另有命令行接口和插件(AI 摘要、字幕自动调整)。
调参与排错:慢、不准、卡显存怎么办
三条硬建议:按硬件选模型档位;手动指定语言别交给自动检测;有显卡就开 GPU(NVIDIA 走 Faster Whisper + CUDA,其他走 Whisper.cpp + Vulkan)。
| 症状 | 对策 |
|---|---|
| 转录太慢 | 降模型档位,换 Faster Whisper / Whisper.cpp 后端 |
| 识别不准 | 手动选语言;换更大模型;术语写进初始提示词 |
| 显存/内存紧张 | 下量化版模型(如q_5),偏好里开"减少 GPU 显存" |
| 麦克风报错 PaErrorCode-9999 | 检查系统隐私设置中的麦克风权限 |
更多细节见 FAQ。
与云端转录服务对比
| 维度 | Buzz | 云端转录服务 |
|---|---|---|
| 隐私 | 音频不离开本机 | 需上传到云端 |
| 网络 | 离线可用(首次下模型除外) | 依赖稳定网络 |
| 费用 | 开源免费 | 按分钟或按月计费 |
| 速度 | 取决于本地硬件 | 取决于服务负载 |
| 可定制 | 模型、后端、插件、导出模板均可改 | 通常有限 |
取舍很简单:敏感内容、弱网环境、批量跑文件选 Buzz;只图"扔进去就出字"、不在乎数据上云的话,云服务的省心也是真的省心。
下一步做什么
项目迭代很快:1.5.0 起接入 Parakeet、Qwen3-ASR、VibeVoice ASR 等新模型家族,插件系统已内置 AI 摘要与字幕自动调整;移动端和云备份官方尚未提及。中文说明见 readme/README.zh_CN.md。
现在就可以试:
- 按上表装好 Buzz,导入第一个音频文件
- 用 medium 档转一遍,再换 tiny 档对比速度和准确率
- 开启文件夹监视,让下一个会议自动出纪要
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考