Buzz:完全离线的语音转文字工具,本地 Whisper 转录三步上手
2026/9/7 3:18:19 网站建设 项目流程

Buzz:完全离线的语音转文字工具,本地 Whisper 转录三步上手

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

周五晚上,三小时的访谈录音还躺在桌面文件夹里。两小时后,一份带时间戳的文字稿出现在导出目录,连每段话对应谁说的都标好了——这是 Buzz 在你笔记本上跑出来的结果,全程没有任何一秒音频被上传。

一句话定位:跑在本地电脑里的离线语音转文字

Buzz 是一款开源免费的桌面应用,把 OpenAI Whisper 搬到本地运行:转写或翻译音频、视频文件,也能处理 YouTube 链接和麦克风实时录音,转完还能在查看器里搜索、编辑、同步播放,再导出成你需要的格式。

  • 协议:MIT
  • 运行:完全离线,音频不离开本机
  • 平台:Windows / macOS / Linux / PyPI
  • 模型:Whisper 五档 + 4 种推理后端
  • 语言:约 99 种,MMS 可及上千种

工作原理:本地 Whisper 怎么把音频变文字

链路很直接:导入的媒体先经 ffmpeg 转成 16kHz 单声道,喂给本机模型做推理,输出带起止时间的文本段落,再导出成最终格式。模型文件下载一次就缓存在本地(Linux 在~/.cache/Buzz),之后的转写不需要网络。

模型分 tiny、base、small、medium、large 五档外加 turbo:tiny 快但错得多,large 最准但吃硬件,日常用 medium 或 small 通常够用。后端也有四种:NVIDIA 显卡且显存 6GB 以上选 Faster Whisper;其他显卡或纯 CPU(包括 Mac)选 Whisper.cpp,走 Vulkan 加速。

落地三步:离线安装 Buzz 到拿到第一批文字

三个平台的安装差异:

平台安装方式
Windows官方安装包,未签名,选"更多信息 → 仍要运行"
macOS下载.dmg拖进应用程序
Linuxflatpak install flathub io.github.chidiwilliams.Buzzsudo snap install buzz

Python 用户也可以:

pip install buzz-captions python -m buzz

需 Python 3.12 环境,并先装好 ffmpeg。

首次使用:点左上角+导入文件,选好模型档位、语言、任务(转写或翻译成你的语言),点运行。完成后双击任务行打开转录查看器——能搜索、逐句编辑、播放与文字联动,最后导出 TXT、SRT 或 VTT 三种格式。

三个真实工作流:访谈、字幕与多语言

如果是记者:把两小时访谈变文字稿

采访结束的当晚是黄金整理期,而 Buzz 的查看器就是为此设计的。

  • medium 档换准确率,语言手动指定
  • 播放到哪儿,光标跟到哪儿
  • TXT 给文字稿,SRT 留给后期

🎬 如果是视频创作者:把录音变成 SRT 字幕

Buzz 可以直接导入 MP4,自动提取音轨转写,产出的字幕还能二次整理。

  • 用"调整大小"合并过短字幕条
  • 长句按标点拆成多条
  • 导出 SRT / VTT 拖进剪辑软件

如果是多语言资料:直接翻译成目标语言

面对外语讲座、会议录像,把任务从"转写"切成"翻译",Buzz 会直接产出你指定的目标语言文本,和原声一样带时间戳。冷门语种可以换模型解决:MMS 家族覆盖上千种语言,在模型偏好里按需下载即可。

进阶玩法:实时转录、文件夹监视、说话人识别

实时转录:麦克风边说边出字,"追加并校正"模式还会回改上一句的错字。开启实时导出后,文字实时写进一个 txt 文件,可直接喂给 OBS 做直播字幕。

文件夹监视:指一个输入目录和输出位置,新音频丢进去自动转写并导出,会议录音落地就出纪要,不用人守。

说话人识别:多人对话自动区分说话人并打上标签,导出文本里"谁在什么时候说了什么"一目了然。

其余一句话带过:嘈杂录音可先做语音分离降噪、支持导入 YouTube 链接、快捷键全可自定义、导出文件名支持{{ input_file_name }}模板变量、另有命令行接口和插件(AI 摘要、字幕自动调整)。

调参与排错:慢、不准、卡显存怎么办

三条硬建议:按硬件选模型档位;手动指定语言别交给自动检测;有显卡就开 GPU(NVIDIA 走 Faster Whisper + CUDA,其他走 Whisper.cpp + Vulkan)。

症状对策
转录太慢降模型档位,换 Faster Whisper / Whisper.cpp 后端
识别不准手动选语言;换更大模型;术语写进初始提示词
显存/内存紧张下量化版模型(如q_5),偏好里开"减少 GPU 显存"
麦克风报错 PaErrorCode-9999检查系统隐私设置中的麦克风权限

更多细节见 FAQ。

与云端转录服务对比

维度Buzz云端转录服务
隐私音频不离开本机需上传到云端
网络离线可用(首次下模型除外)依赖稳定网络
费用开源免费按分钟或按月计费
速度取决于本地硬件取决于服务负载
可定制模型、后端、插件、导出模板均可改通常有限

取舍很简单:敏感内容、弱网环境、批量跑文件选 Buzz;只图"扔进去就出字"、不在乎数据上云的话,云服务的省心也是真的省心。

下一步做什么

项目迭代很快:1.5.0 起接入 Parakeet、Qwen3-ASR、VibeVoice ASR 等新模型家族,插件系统已内置 AI 摘要与字幕自动调整;移动端和云备份官方尚未提及。中文说明见 readme/README.zh_CN.md。

现在就可以试:

  • 按上表装好 Buzz,导入第一个音频文件
  • 用 medium 档转一遍,再换 tiny 档对比速度和准确率
  • 开启文件夹监视,让下一个会议自动出纪要

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询