Buzz:离线转录,把音频变成可搜索的文字
2026/9/13 17:10:31 网站建设 项目流程

Buzz:离线转录,把音频变成可搜索的文字

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

三小时的访谈录音躺在桌面上,明天就要交文字稿。Buzz 用 Whisper 在你自己的电脑上完成离线音频转录与翻译,文件不经过云端。适合整理课程笔记的学生、做字幕的创作者,以及不想上传录音的人。

三分钟上手

按系统选一种安装方式:

  • macOS / Windows:从 SourceForge 下载预编译包。macOS 新版只支持 Apple 芯片(Intel 机型请用 1.4.5);Windows 安装包未签名,安装告警选"更多信息 → 仍要运行"
  • Linux
flatpak install flathub io.github.chidiwilliams.Buzz
  • PyPI(需 Python 3.12,先装 ffmpeg):
pip install buzz-captions python -m buzz

首次运行三步走:

  1. 点工具栏"+"(或Ctrl/Cmd + O),选一个音频/视频文件
  2. 选任务(转录或翻译成英语)、选语言、选模型
  3. Run,状态变成 Completed 后双击该行打开转录结果

主界面是一张任务列表:可以排队多个文件,每行显示进度,YouTube 链接也能直接导入。

核心能力

导入文件,得到 TXT / SRT / VTT

手工听写意味着数小时的工作。把文件导入窗口(可多选),导出格式选 TXT、SRT 或 VTT,点 Run。完成后得到带时间戳的转录稿,字幕文件可直接拖进剪辑软件。

边说边转:实时录音

会议和讲座里,点工具栏麦克风按钮,选好麦克风和语言,点 Record,句子实时出现;演示窗口还能把实时字幕投给观众。核显笔记本配 Whisper.cpp 加小模型也能跑实时转录。

转录查看器:搜索、播放、修正

双击任务行打开查看器:每行有 Start / End / Text,点行即跳到对应音频位置,支持关键词搜索、播放调速,错词直接改。

说话人识别:谁说了什么

在查看器点Identify speakers,MSDD 模型按说话人分组,你可以把自动标签改成真实姓名,勾选"Merge speaker sentences"能把同一人的连续句子合并。访谈稿从此分得清问答。

进阶选项:引擎与模型怎么选

引擎适合谁
Whisper.cpp无 N 卡、Mac 或核显;Vulkan 加速,CPU 也能跑实时
Faster WhisperN 卡显存 ≥6GB,速度快、内存占用低
Whisper通用,准确度高、资源占用高
HuggingFace想用自定义语言模型(MMS 覆盖 1000+ 种语言)

模型按大小挑:越小越快但越不准,large-v3 更准但更慢,large-v3-turbo 在速度和准确间取平衡,名字带.En的只支持英语。从 medium 起步,嫌慢就换 small。

插件扩展

Help → Plugins里开关插件,拖拽调整执行顺序:

  • AI 摘要plugins/ai_summary/:转录完调用 OpenAI 兼容 API(支持本地 Ollama)生成摘要,写进转录稿 Notes 或音频旁的文本文件
  • 字幕重排plugins/transcript_resizer/:把词级分段合并成字幕长度,支持最大字数和按标点切分
  • 跳过已转录plugins/skip_already_transcribed/:重复导入或监控文件夹时不重跑

场景验证

  • 播客编辑:以前把音频传给在线转录服务,上传下载要等,还担心内容外流;现在把文件拖进窗口,直接导出 SRT。一条视频的字幕周期从半天缩到一次转录。
  • 访谈记者:以前靠反复听十几小时访谈手动分段、标注;现在说话人识别按人分组,搜索直接跳关键词。省掉的是重听时间。
  • 外语学生:以前 45 分钟的课要手写一遍;现在导入录音、选好语言,查看器里边听边对。手写一晚上的事省了。

避坑与FAQ

  • 转录太慢:换小一档模型,或引擎改 Whisper.cpp;Faster Whisper 至少需要 6GB 显存
  • 断网能用吗:能。在有网电脑下载模型,把模型目录(Linux 为~/.cache/Buzz/models)拷到离线机同位置
  • 安装与麦克风告警:Windows 未签名告警选"仍要运行"即可;麦克风报错 9999 去系统设置里查麦克风权限
  • 启动崩溃:多为模型下载中断,Help → Preferences → Models 删掉重下;CPU 需支持 AVX2

下一步行动

  1. 下载你系统的预编译版本,导入一段自己的录音跑通全流程
  2. Help → Preferences → Models下载 medium 模型,用自己母语测一次准确率
  3. 获取源码与更多文档:
git clone https://gitcode.com/GitHub_Trending/buz/buzz

仓库内 docs/docs/ 还有完整的用法与 FAQ。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询