☰
Buzz 语音转写实战:本地离线把任意音频变成 SRT 字幕
2026/9/30 1:47:43 网站建设 项目流程

Buzz 语音转写实战:本地离线把任意音频变成 SRT 字幕

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款本地语音转文字工具:基于 OpenAI Whisper,在你的电脑上全程离线转写、翻译音频和视频,支持导出 TXT / SRT / VTT。读完这篇指南,你能按系统装好它,并产出第一份带时间轴的字幕文件。

📦 交付物速览:你会拿到什么

装好 Buzz 后,你实际产出的是这几样东西:

  • 三种格式的文字稿:TXT(纯文本笔记)、SRT / VTT(带时间轴的字幕),在转录详情页右上角一键导出,详见 转录查看器说明
  • 带时间轴的分段文本:每段都有起止时间,点任意一行,播放器立刻跳到对应音频位置,方便边听边校对
  • 三种输入来源:本地音频/视频文件、在线视频链接、麦克风实时录音
  • 翻译能力:Whisper 内置"转写+翻译成英文";配置 AI 接口后可翻译成中文等任意语言,见 翻译指南
  • 噪音应对:开启"提取语音"(基于 Demucs 声分离)可先把人声从背景里剥离,嘈杂录音识别更干净
  • 自动批处理:文件夹监控模式会接住新丢进来的文件自动排队转写

边界也说清楚:音频不上传、不按分钟计费;首次使用某个模型时需联网下载一次,之后离线可用。

🖥️ 环境就绪:四种安装方式按系统选

  • Windows:下载官方发布页的安装包双击安装。应用未签名,弹出安全警告时点「更多信息」→「仍要运行」。
  • macOS:下载.dmg拖入「应用程序」。注意 Buzz 现仅支持 Apple Silicon,Intel Mac 最后可用版本是 1.4.5。
  • Linux(Snap):sudo apt-get install libportaudio2 libcanberra-gtk-module libcanberra-gtk3-module && sudo snap install buzz,再sudo snap connect buzz:password-manager-service授权密码存储;也可用 Flatpak:flatpak install flathub io.github.chidiwilliams.Buzz。
  • Python 环境:先装好 ffmpeg,再用 Python 3.12 执行pip install buzz-captions,启动命令是python -m buzz。

NVIDIA 显卡用户:1.4.6 起 CUDA 加速需单独装,进Help → About Buzz → Install CUDA Acceleration即可,无需手动配环境。更多细节见 安装文档。

🚀 首次跑通:从导入到导出的五步

  1. 导入文件:Ctrl/Cmd + O或点工具栏「+」,选择 MP3 / MP4 等音视频文件(详见 文件导入文档)。
  2. 选参数:在任务行里挑模型档位(首次建议 tiny 或 base,下载快)、任务类型(转写)、语言(不确定就自动检测)。
  3. 点 Run:如果模型不在本地,会自动开始下载——最常见的卡点就在这里,下载慢或被中断都会让任务停在队列里。
  4. 状态变 Completed 后双击该行,打开转录详情。
  5. 右上角菜单选 TXT / SRT / VTT 导出,文件默认存到输入文件所在目录。

第一次建议用一小段音频跑通全流程,别一上来就丢两小时的录音。

⚙️ 核心流程与参数速查

主路径四步:导入 → 选参数 → 校对 → 导出。队列里每项都显示文件、模型、任务类型与实时进度,关掉窗口任务仍在后台继续。

校对阶段,双击已完成任务进入转录详情:点任意段落到音频对应位置,直接改文字即可,改动自动保存。字幕行太长时,用「Resize」按钮按最大长度自动拆分或合并,详见 编辑与调整指南。

参数常见取值作用
模型档位tiny / base / small / medium / large速度 ↔ 准确率平衡点
Whisper 类型whisper / whisper.cpp / faster-whisper / huggingface不同后端:whisper.cpp 通吃 CPU 与各种 GPU,faster-whisper 适合 6GB 显存以上的 NVIDIA
任务转写 / 翻译翻译 = 转写 + 翻译成英文一步完成
语言手动指定或自动检测短音频、混合语言建议手动指定更稳
词级时间轴开 / 关开启后每词一行,便于后续精细合并字幕
初始提示词常见专有名词在「高级」里填写,减少人名术语拼错
提取语音开 / 关嘈杂环境先分离人声再转写
输出格式TXT / SRT / VTT字幕用 SRT,纯笔记用 TXT

🎬 场景演练:三个高频用法

如果你要把两小时采访录音变成可用文字稿,这样做:

  1. 录音拖进队列,模型选 small 或 medium(有 NVIDIA 显卡就开 CUDA,速度快数倍)
  2. 等状态变 Completed,双击打开详情
  3. 边播放边校对人名、术语;拿不准的词以后可以填进「初始提示词」
  4. 导出 TXT 发出去,收工

如果你要给英文视频做中文字幕,这样做:

  1. 拖入视频,任务类型选 Translate,先用 Whisper 转写并翻译成英文
  2. 在转录详情页点「Translate」,配置 AI 接口后指定目标语言为中文(见 翻译指南)
  3. 导出 SRT,预览发现某行太长
  4. 打开 Resize,设好目标长度:长句按标点自动拆、碎片自动合并

如果你想让团队共享的录音自动转写,这样做:

  1. 在 Preferences 里开启文件夹监控,指向共享目录(设置项见 偏好设置文档)
  2. 同事丢文件进来,Buzz 自动排队处理,转写结果落在输出目录
  3. 想跳过已有文稿的文件,启用 skip already transcribed 插件

🚀 性能与进阶:关键开关怎么拨

  • 模型档位→ 决定速度与准确率的平衡 → 日常笔记用 base、快速试听用 tiny、交付级字幕上 large-v3。
  • Whisper 类型→ 决定跑在哪个后端 → 没有 NVIDIA 卡选 whisper.cpp(可吃任意 GPU 甚至纯 CPU);显存 ≥ 6GB 的 NVIDIA 选 faster-whisper 提速明显。
  • CUDA 加速→ 1.4.6 起单独安装 → 装好后 large 模型转写提速数倍;没有 NVIDIA 卡就不用管。
  • 提取语音(声分离)→ 先剥离背景音再转写 → 会议室、街头等嘈杂录音开,干净录音不开以免浪费算力。
  • 输出目录与文件名模板→ 在 Preferences 里一次配好{{ input_file_name }}等变量 → 批量导出位置命名统一,文稿不散落。
  • 离线机器→ 在有网电脑下好模型,把缓存目录拷到离线机同位置(Linux 为~/.cache/Buzz)→ 或用 scripts/download-models.py 预准备模型。

命令行党可以直接用 CLI 批量跑,例如对一整文件夹出 SRT:buzz add --srt --output-directory ./subtitles recordings/*.mp4,全部选项见 CLI 文档。

🔍 排错对照:常见卡点与动作

  • 转写比预期慢?→ 先降一档模型 → 换 whisper.cpp 后端 → 有 NVIDIA 卡装 CUDA → 别并行跑多个大任务。
  • 任务一直排队不动?→ 多半是模型没下完,回 Models 页确认模型就位后重新排队。
  • 识别错漏太多?→ 换 large 模型重跑;专有名词写进「初始提示词」;录音嘈杂先开「提取语音」。
  • 自动检测语言不准?→ 手动指定语言代码,短音频和混合语言尤其必要。
  • 超大文件内存吃紧?→ 降一档模型或先切段分批处理;显存紧张可开启 GPU 显存压缩选项。
  • 录音报错(PaErrorCode-9999)?→ 检查系统隐私设置里 Buzz 的麦克风权限,或被安全软件拦截。
  • Buzz 崩溃?→ 模型可能下载损坏,在 Models 页删除后重新下载;老 CPU 注意 Buzz 需要 AVX2 指令集。
  • 完全离线的电脑怎么用?→ 拷贝模型缓存目录即可,模型位置见 FAQ。

写在最后

Buzz 把整套 Whisper 转写工作站装进你的电脑:不上传、不计费,从丢进文件到导出字幕全程离线。挑一种装法装好,把第一段音频拖进去,文字稿和字幕就都有了。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询