Buzz 离线音频转录完整指南:三步在本地跑起来语音转文字
2026/9/7 8:47:30 网站建设 项目流程

Buzz 离线音频转录完整指南:三步在本地跑起来语音转文字

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

开会录音不想上传给云端?在线转录服务按分钟收费还担心隐私?Buzz 就是一个本地离线音频转录工具:音频全程留在你的电脑上,由 OpenAI 的 Whisper 模型在本地完成语音转文字,免费、开源、可完全断网使用。

项目快照:Buzz 是什么

Buzz 是一款桌面应用,底层跑的是 Whisper 语音识别技术(OpenAI 开源的语音转文字模型),支持 99 种以上语言的转录,还能把非英语音频直接翻译成英文文本。除了导入本地文件,它也支持直接录麦克风实时转录、导入 YouTube 链接,甚至可以通过命令行脚本化批处理。

项目速览说明
输入格式MP3、WAV、MP4、M4A 等主流音频/视频文件,或麦克风实时录音
语言支持99+ 种语言(Whisper);可接 MMS 等模型扩展至 1000+ 种
是否联网转录完全本地进行,可断网使用(模型首次需联网下载)
是否收费免费,MIT 开源协议

环境搭建:分平台最短安装路径

平台安装方式
Windows / macOS从项目发布页下载安装包(.exe / .dmg),双击安装即可;Windows 首次安装若提示未签名,选"仍要运行"
Linuxsudo snap install buzz,或flatpak install flathub io.github.chidiwilliams.Buzz
Python 环境pip install buzz-captions,然后python -m buzz启动(需 Python 3.12 并安装 ffmpeg)

两点提示:

  • 首次运行会自动下载所选 Whisper 模型到本地缓存目录(Linux 在~/.cache/Buzz,macOS 在~/Library/Caches/Buzz),建议先在有网环境跑一次。
  • 完全离线的机器,可先在有网电脑下载模型,把模型文件夹整体拷过去即可,官方还附带了离线模型准备脚本 scripts/download-models.py。

能力全景:Buzz 能做什么

核心能力一句话说明
批量文件转录一次导入多个文件,自动排队、显示进度,完成即导出
多后端模型Whisper / Faster Whisper / Whisper.cpp / HuggingFace 四种后端,覆盖 NVIDIA GPU、Apple Silicon、核显 Vulkan、纯 CPU
实时录音转录麦克风边录边转,支持"追加并纠正"模式,可开演讲窗口投屏
转录查看器带搜索、播放控制、语速调节、时间戳微调的编辑器
字幕与文本处理字幕重排(Resize)、说话人识别、导出 TXT / SRT / VTT / DOCX
自动与脚本化文件夹监控自动转录新文件、命令行 CLI、插件系统

场景实战一:会议记录,实时录音转成文字

目标:开一场 1 小时会议,结束后手里有一份带时间戳的文字记录。

  1. 在 Buzz 主界面选择任务(Transcribe)、明确选定语言(如中文,比"自动检测"更稳)、选麦克风。
  2. 后端选Whisper.cpp、模型选 Tiny 或 Base——实时转录对算力敏感,小模型 + Whisper.cpp 是低延迟组合,核显甚至纯 CPU 也能跑。
  3. 点 Record 开始录制,文字随语音实时出现在界面上;需要投屏展示可打开 Presentation Window(演讲窗口)。
  4. 会议结束停止录音,双击任务行打开转录结果,导出为 TXT 或 SRT。

产出:一份带时间戳的完整会议转录文本,全程没有离开你的电脑。

场景实战二:视频批量做字幕,导出 SRT 进剪辑软件

目标:把一周积累的 5 个 MP4 视频批量转成可直接套用的 SRT 字幕。

  1. 文件菜单"Import Media File"(或 Ctrl/Cmd + O)一次性勾选所有视频文件,加入任务队列。
  2. 每个任务把Export As设为 SRT,并勾选Word-Level Timings(逐字时间戳)——这是后面能用字幕重排工具自由合并长短的关键。
  3. 按硬件选模型:有 NVIDIA 显卡选 Faster Whisper + Medium 追求平衡,追求精度选 Large 系列。点 Run 后 Buzz 自动逐个排队处理。
  4. 完成后双击打开转录查看器:用播放和语速控制核对每一句,点Resize按钮设置单条字幕最大长度(40~50 字符较合适)、是否按标点断句,重新合并后导出。

产出:5 个时长合规、可直接导入剪辑软件的 SRT 文件。

场景实战三:访谈录音,分说话人整理资料

目标:一段多人访谈,整理出"谁在什么时间说了什么"的稿子。

  1. 导入访谈音频,点 Advanced 按钮填Initial prompt(初始提示词),把人名、专业术语写进去,能显著减少专有名词的错字。
  2. 转录完成后打开查看器,点Identify speakers(说话人识别),Buzz 自动把每句话打上说话人标签。
  3. 每个标签可试听 10 秒随机片段来确认身份,把自动标签改成真实姓名;勾选"合并同一说话人语句"再保存。
  4. 导出成 TXT/DOCX(DOCX 由插件提供),进入资料归档流程。

产出:带说话人姓名、可合并段落的访谈整理稿。

调优与排错:选对模型和后端

场景 / 硬件建议效果
笔记本、无独显,实时转录Whisper.cpp 后端 + Tiny/Base 小模型延迟低,核显/纯 CPU 可用
NVIDIA 显卡(6GB 显存以上)Faster Whisper + Medium速度与精度平衡,比原始 Whisper 快多个量级
追求最高精度(论文、出版级)Large-V3 或 Turbo精度最佳;Large-V3 偶发"幻觉"(写出音频里没有的词),重要内容建议抽检
完全断网环境拷贝模型目录,或用 scripts/download-models.py 预置模型缓存离线机器开箱即转

高频问答

  • Q:转录太慢?A:换更小的模型,或改用 Whisper.cpp;有独显就开 GPU 加速(Windows 安装包自带 CUDA,Linux 开箱即用)。

  • Q:准确率不理想?A:换大一号模型;明确选定语言而不是自动检测;用 Initial prompt 把高频专有名词喂给模型。

  • Q:录不进声音,报 PaErrorCode-9999?A:检查系统给 Buzz 的麦克风权限(Windows 在"设置 → 隐私 → 麦克风"),临时关闭杀毒软件测试。

进阶与资源

Buzz 自带插件系统(plugins/),内置 AI 摘要、字幕自动重排、DOCX 导出、降噪(DeepFilterNet)、语言检测增强等,也支持自己写插件扩展;常用入口:

  • 内置插件源码:plugins/ai_summary/、plugins/transcript_resizer/、plugins/export_docx/
  • 使用文档(文件导入 / 实时录音 / 说话人识别等):docs/docs/usage/
  • 命令行用法(脚本化批量转录):docs/docs/cli.md
  • 常见问题(模型存放位置、GPU 加速、离线使用):docs/docs/faq.md

写在最后

Buzz 把"语音转文字"这件过去依赖云端的事,完整地搬回了你自己的电脑:文件不上行、费用为零、断网可跑,从会议速记到视频字幕都能覆盖。装好后从最小的 Tiny 模型试一条文件,再按精度需求逐步升级,十分钟就能进入工作流。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询