Buzz 离线音频转录完整指南:三步在本地跑起来语音转文字
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
开会录音不想上传给云端?在线转录服务按分钟收费还担心隐私?Buzz 就是一个本地离线音频转录工具:音频全程留在你的电脑上,由 OpenAI 的 Whisper 模型在本地完成语音转文字,免费、开源、可完全断网使用。
项目快照:Buzz 是什么
Buzz 是一款桌面应用,底层跑的是 Whisper 语音识别技术(OpenAI 开源的语音转文字模型),支持 99 种以上语言的转录,还能把非英语音频直接翻译成英文文本。除了导入本地文件,它也支持直接录麦克风实时转录、导入 YouTube 链接,甚至可以通过命令行脚本化批处理。
| 项目速览 | 说明 |
|---|---|
| 输入格式 | MP3、WAV、MP4、M4A 等主流音频/视频文件,或麦克风实时录音 |
| 语言支持 | 99+ 种语言(Whisper);可接 MMS 等模型扩展至 1000+ 种 |
| 是否联网 | 转录完全本地进行,可断网使用(模型首次需联网下载) |
| 是否收费 | 免费,MIT 开源协议 |
环境搭建:分平台最短安装路径
| 平台 | 安装方式 |
|---|---|
| Windows / macOS | 从项目发布页下载安装包(.exe / .dmg),双击安装即可;Windows 首次安装若提示未签名,选"仍要运行" |
| Linux | sudo snap install buzz,或flatpak install flathub io.github.chidiwilliams.Buzz |
| Python 环境 | pip install buzz-captions,然后python -m buzz启动(需 Python 3.12 并安装 ffmpeg) |
两点提示:
- 首次运行会自动下载所选 Whisper 模型到本地缓存目录(Linux 在
~/.cache/Buzz,macOS 在~/Library/Caches/Buzz),建议先在有网环境跑一次。 - 完全离线的机器,可先在有网电脑下载模型,把模型文件夹整体拷过去即可,官方还附带了离线模型准备脚本 scripts/download-models.py。
能力全景:Buzz 能做什么
| 核心能力 | 一句话说明 |
|---|---|
| 批量文件转录 | 一次导入多个文件,自动排队、显示进度,完成即导出 |
| 多后端模型 | Whisper / Faster Whisper / Whisper.cpp / HuggingFace 四种后端,覆盖 NVIDIA GPU、Apple Silicon、核显 Vulkan、纯 CPU |
| 实时录音转录 | 麦克风边录边转,支持"追加并纠正"模式,可开演讲窗口投屏 |
| 转录查看器 | 带搜索、播放控制、语速调节、时间戳微调的编辑器 |
| 字幕与文本处理 | 字幕重排(Resize)、说话人识别、导出 TXT / SRT / VTT / DOCX |
| 自动与脚本化 | 文件夹监控自动转录新文件、命令行 CLI、插件系统 |
场景实战一:会议记录,实时录音转成文字
目标:开一场 1 小时会议,结束后手里有一份带时间戳的文字记录。
- 在 Buzz 主界面选择任务(Transcribe)、明确选定语言(如中文,比"自动检测"更稳)、选麦克风。
- 后端选Whisper.cpp、模型选 Tiny 或 Base——实时转录对算力敏感,小模型 + Whisper.cpp 是低延迟组合,核显甚至纯 CPU 也能跑。
- 点 Record 开始录制,文字随语音实时出现在界面上;需要投屏展示可打开 Presentation Window(演讲窗口)。
- 会议结束停止录音,双击任务行打开转录结果,导出为 TXT 或 SRT。
产出:一份带时间戳的完整会议转录文本,全程没有离开你的电脑。
场景实战二:视频批量做字幕,导出 SRT 进剪辑软件
目标:把一周积累的 5 个 MP4 视频批量转成可直接套用的 SRT 字幕。
- 文件菜单"Import Media File"(或 Ctrl/Cmd + O)一次性勾选所有视频文件,加入任务队列。
- 每个任务把Export As设为 SRT,并勾选Word-Level Timings(逐字时间戳)——这是后面能用字幕重排工具自由合并长短的关键。
- 按硬件选模型:有 NVIDIA 显卡选 Faster Whisper + Medium 追求平衡,追求精度选 Large 系列。点 Run 后 Buzz 自动逐个排队处理。
- 完成后双击打开转录查看器:用播放和语速控制核对每一句,点Resize按钮设置单条字幕最大长度(40~50 字符较合适)、是否按标点断句,重新合并后导出。
产出:5 个时长合规、可直接导入剪辑软件的 SRT 文件。
场景实战三:访谈录音,分说话人整理资料
目标:一段多人访谈,整理出"谁在什么时间说了什么"的稿子。
- 导入访谈音频,点 Advanced 按钮填Initial prompt(初始提示词),把人名、专业术语写进去,能显著减少专有名词的错字。
- 转录完成后打开查看器,点Identify speakers(说话人识别),Buzz 自动把每句话打上说话人标签。
- 每个标签可试听 10 秒随机片段来确认身份,把自动标签改成真实姓名;勾选"合并同一说话人语句"再保存。
- 导出成 TXT/DOCX(DOCX 由插件提供),进入资料归档流程。
产出:带说话人姓名、可合并段落的访谈整理稿。
调优与排错:选对模型和后端
| 场景 / 硬件 | 建议 | 效果 |
|---|---|---|
| 笔记本、无独显,实时转录 | Whisper.cpp 后端 + Tiny/Base 小模型 | 延迟低,核显/纯 CPU 可用 |
| NVIDIA 显卡(6GB 显存以上) | Faster Whisper + Medium | 速度与精度平衡,比原始 Whisper 快多个量级 |
| 追求最高精度(论文、出版级) | Large-V3 或 Turbo | 精度最佳;Large-V3 偶发"幻觉"(写出音频里没有的词),重要内容建议抽检 |
| 完全断网环境 | 拷贝模型目录,或用 scripts/download-models.py 预置模型缓存 | 离线机器开箱即转 |
高频问答
Q:转录太慢?A:换更小的模型,或改用 Whisper.cpp;有独显就开 GPU 加速(Windows 安装包自带 CUDA,Linux 开箱即用)。
Q:准确率不理想?A:换大一号模型;明确选定语言而不是自动检测;用 Initial prompt 把高频专有名词喂给模型。
Q:录不进声音,报 PaErrorCode-9999?A:检查系统给 Buzz 的麦克风权限(Windows 在"设置 → 隐私 → 麦克风"),临时关闭杀毒软件测试。
进阶与资源
Buzz 自带插件系统(plugins/),内置 AI 摘要、字幕自动重排、DOCX 导出、降噪(DeepFilterNet)、语言检测增强等,也支持自己写插件扩展;常用入口:
- 内置插件源码:plugins/ai_summary/、plugins/transcript_resizer/、plugins/export_docx/
- 使用文档(文件导入 / 实时录音 / 说话人识别等):docs/docs/usage/
- 命令行用法(脚本化批量转录):docs/docs/cli.md
- 常见问题(模型存放位置、GPU 加速、离线使用):docs/docs/faq.md
写在最后
Buzz 把"语音转文字"这件过去依赖云端的事,完整地搬回了你自己的电脑:文件不上行、费用为零、断网可跑,从会议速记到视频字幕都能覆盖。装好后从最小的 Tiny 模型试一条文件,再按精度需求逐步升级,十分钟就能进入工作流。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考