Buzz 离线语音转文字工具:3 步跑通第一条转录,全程无需联网
2026/9/7 5:52:56 网站建设 项目流程

Buzz 离线语音转文字工具:3 步跑通第一条转录,全程无需联网

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款基于 OpenAI Whisper 的免费开源离线转录工具,模型全部运行在你的电脑上,能把音频、视频转成可编辑的文本和字幕文件。它适合需要处理会议录音、采访素材或课程内容,又不想把音频上传到云端的人,下面按实际使用顺序讲一遍。

适不适合你

Buzz 的识别、翻译都在本地完成,音频不经过任何服务器,但性能也完全取决于你手里的硬件,先对照四个条件判断 🎯:

  • 隐私要求:处理敏感内容、单位要求数据不出内网时,本地处理是刚需;如果无所谓上传云端,其他在线服务也够用。
  • 网络条件:只有首次下载模型需要联网,之后可以断网使用。仓库提供了 scripts/download-models.py 脚本,可在一台联网机器上备好模型,拷贝到离线机器使用。
  • 硬件条件:较新的 CPU 和带核显的笔记本都能跑;有 NVIDIA 显卡则明显更快,太老的机器(CPU 不支持 AVX2 指令)无法使用。
  • 局限:大模型更准但下载体积以 GB 计,转录速度也有上限,一条一小时录音在纯 CPU 上可能要等相当久,别指望"实时出稿"。

完成第一次转录

按真实顺序走一遍:安装 → 导入 → 选模型 → 运行 → 导出。

各系统安装方式

  1. Windows:到项目 Releases 页下载安装程序双击运行。应用未签名,安装时如提示安全警告,选"更多信息 → 仍要运行"即可。
  2. macOS:下载.dmg拖入 Applications,也可以直接用 Homebrew 安装 buzz 的 cask 包。
  3. Linux:一条命令装 Flatpak 版本,或改用 Snap:sudo snap install buzz

从导入到导出的完整操作

  1. 导入音频:点工具栏"+"按钮(或 Ctrl/Cmd+O)选择音频或视频文件,预期结果是任务队列里多出一条待处理记录。
  2. 选模型:CPU 为主选 Whisper.cpp 后端,再定一个模型大小(参考下节表格);语言一栏直接指定语种,不建议留自动检测。
  3. 运行:点 Run,等状态变为 Completed,期间可继续导入其他文件排队。
  4. 导出:双击结果行打开查看器,选 TXT、SRT 或 VTT 保存,文本可直接编辑后再导出。

转录更快更准

除模型大小外,后端(Whisper、Faster Whisper、Whisper.cpp)的选择同样影响速度和内存占用 ⚡。常见 Whisper 系列的取舍如下,体积以实测常见值为准:

模型体积速度准确率适用场景
Tiny约 75MB最快基础实时转录、低配设备
Base约 142MB良好日常速览
Small约 466MB中等优秀多数正式场景
Medium约 1.5GB较慢对质量有要求、硬件够
Large约 3.1GB最慢最高专业级、离线精转

按你的硬件挑后端

  • NVIDIA 显卡(显存 ≥ 6GB):Faster Whisper + CUDA,Windows 安装包已内置 CUDA 支持。
  • 其他显卡或核显:Whisper.cpp,可走 Vulkan 加速,Mac 上首选它。
  • 纯 CPU:Whisper.cpp 也可跑,线程数默认是 CPU 核心数的一半,调高线程未必更快,不建议盲目拉满。

显存吃紧时,可在偏好设置里选 Whisper.cpp 的量化版本(如q_5),内存占用更小。

用到实际业务里

三个高频场景的配置建议,照着设即可:

  • 会议记录:指定会议语言;人名、项目代号写进"高级"里的初始提示,能明显减少错拼,导出带时间戳的 TXT。
  • 视频字幕:导入 MP4 时开启逐词时间戳,转录完点"Resize"按静音间隔和标点重新断句,控制单行长度再导出 SRT。
  • 批量转录:在偏好里开启文件夹监控,放入新音频自动按默认参数转录,再启用"Skip Already Transcribed"插件避免重复跑同一批文件。

内置插件(AI 摘要、字幕重排、降噪等)的源码都在 buzz/plugins/ 目录,各插件说明见 docs 插件文档 📁。

避坑手册

  • 问题:转录太慢。→ 换小一档模型,或改用 Whisper.cpp 后端;NVIDIA 显卡确认已启用 CUDA。
  • 问题:识别率低、专有名词总错。→ 别用自动检测语言,显式指定语种,并把常错词写进初始提示。
  • 问题:文件导入失败。→ 用 ffmpeg 先转成 MP3、WAV、FLAC 等常见格式再导入。
  • 问题:下载模型后程序崩溃。→ 模型文件多半没下完整,到"帮助 → 偏好设置 → 模型"里删除重下。
  • 想批量跑脚本:装了 pip 版(pip install buzz-captions)后可用一条命令转录两个音频并直接导出 SRT/VTT:buzz add --model-type whispercpp --model-size small --srt --vtt a.mp3 b.mp3

先用一小段音频把整条流程跑通,再拿同一段素材对比两三个模型大小,选定你的默认档位;批量任务稳定后,再考虑开启文件夹监控。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询