Buzz 离线语音转文字工具:3 步跑通第一条转录,全程无需联网
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款基于 OpenAI Whisper 的免费开源离线转录工具,模型全部运行在你的电脑上,能把音频、视频转成可编辑的文本和字幕文件。它适合需要处理会议录音、采访素材或课程内容,又不想把音频上传到云端的人,下面按实际使用顺序讲一遍。
适不适合你
Buzz 的识别、翻译都在本地完成,音频不经过任何服务器,但性能也完全取决于你手里的硬件,先对照四个条件判断 🎯:
- 隐私要求:处理敏感内容、单位要求数据不出内网时,本地处理是刚需;如果无所谓上传云端,其他在线服务也够用。
- 网络条件:只有首次下载模型需要联网,之后可以断网使用。仓库提供了 scripts/download-models.py 脚本,可在一台联网机器上备好模型,拷贝到离线机器使用。
- 硬件条件:较新的 CPU 和带核显的笔记本都能跑;有 NVIDIA 显卡则明显更快,太老的机器(CPU 不支持 AVX2 指令)无法使用。
- 局限:大模型更准但下载体积以 GB 计,转录速度也有上限,一条一小时录音在纯 CPU 上可能要等相当久,别指望"实时出稿"。
完成第一次转录
按真实顺序走一遍:安装 → 导入 → 选模型 → 运行 → 导出。
各系统安装方式
- Windows:到项目 Releases 页下载安装程序双击运行。应用未签名,安装时如提示安全警告,选"更多信息 → 仍要运行"即可。
- macOS:下载
.dmg拖入 Applications,也可以直接用 Homebrew 安装 buzz 的 cask 包。 - Linux:一条命令装 Flatpak 版本,或改用 Snap:
sudo snap install buzz。
从导入到导出的完整操作
- 导入音频:点工具栏"+"按钮(或 Ctrl/Cmd+O)选择音频或视频文件,预期结果是任务队列里多出一条待处理记录。
- 选模型:CPU 为主选 Whisper.cpp 后端,再定一个模型大小(参考下节表格);语言一栏直接指定语种,不建议留自动检测。
- 运行:点 Run,等状态变为 Completed,期间可继续导入其他文件排队。
- 导出:双击结果行打开查看器,选 TXT、SRT 或 VTT 保存,文本可直接编辑后再导出。
转录更快更准
除模型大小外,后端(Whisper、Faster Whisper、Whisper.cpp)的选择同样影响速度和内存占用 ⚡。常见 Whisper 系列的取舍如下,体积以实测常见值为准:
| 模型 | 体积 | 速度 | 准确率 | 适用场景 |
|---|---|---|---|---|
| Tiny | 约 75MB | 最快 | 基础 | 实时转录、低配设备 |
| Base | 约 142MB | 快 | 良好 | 日常速览 |
| Small | 约 466MB | 中等 | 优秀 | 多数正式场景 |
| Medium | 约 1.5GB | 较慢 | 高 | 对质量有要求、硬件够 |
| Large | 约 3.1GB | 最慢 | 最高 | 专业级、离线精转 |
按你的硬件挑后端
- NVIDIA 显卡(显存 ≥ 6GB):Faster Whisper + CUDA,Windows 安装包已内置 CUDA 支持。
- 其他显卡或核显:Whisper.cpp,可走 Vulkan 加速,Mac 上首选它。
- 纯 CPU:Whisper.cpp 也可跑,线程数默认是 CPU 核心数的一半,调高线程未必更快,不建议盲目拉满。
显存吃紧时,可在偏好设置里选 Whisper.cpp 的量化版本(如q_5),内存占用更小。
用到实际业务里
三个高频场景的配置建议,照着设即可:
- 会议记录:指定会议语言;人名、项目代号写进"高级"里的初始提示,能明显减少错拼,导出带时间戳的 TXT。
- 视频字幕:导入 MP4 时开启逐词时间戳,转录完点"Resize"按静音间隔和标点重新断句,控制单行长度再导出 SRT。
- 批量转录:在偏好里开启文件夹监控,放入新音频自动按默认参数转录,再启用"Skip Already Transcribed"插件避免重复跑同一批文件。
内置插件(AI 摘要、字幕重排、降噪等)的源码都在 buzz/plugins/ 目录,各插件说明见 docs 插件文档 📁。
避坑手册
- 问题:转录太慢。→ 换小一档模型,或改用 Whisper.cpp 后端;NVIDIA 显卡确认已启用 CUDA。
- 问题:识别率低、专有名词总错。→ 别用自动检测语言,显式指定语种,并把常错词写进初始提示。
- 问题:文件导入失败。→ 用 ffmpeg 先转成 MP3、WAV、FLAC 等常见格式再导入。
- 问题:下载模型后程序崩溃。→ 模型文件多半没下完整,到"帮助 → 偏好设置 → 模型"里删除重下。
- 想批量跑脚本:装了 pip 版(
pip install buzz-captions)后可用一条命令转录两个音频并直接导出 SRT/VTT:buzz add --model-type whispercpp --model-size small --srt --vtt a.mp3 b.mp3。
先用一小段音频把整条流程跑通,再拿同一段素材对比两三个模型大小,选定你的默认档位;批量任务稳定后,再考虑开启文件夹监控。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考