离线转写本地字幕生成指南:Buzz 让语音秒变文稿,全程不联网
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款跑在你自己电脑上的离线语音转写工具,基于 OpenAI Whisper 模型,支持批量转录、麦克风实时转写和字幕导出,最适合不想把录音上传到任何服务器的会议记录、课程笔记和字幕制作场景。
为什么值得试 Buzz 这套方案 🎯
结论先说:音频不用出你的电脑,这是它和在线转写服务最大的区别。
- 全程离线:识别在本地完成,商务录音、课程音频不需要经过第三方服务器
- 三种 Whisper 后端可选:N 卡走 CUDA、Mac 走 Apple Silicon、普通电脑用 Whisper.cpp(支持集显 Vulkan 加速)
- 一次转写,多格式产出:TXT、SRT、VTT 直接导出,文稿和字幕一份录音搞定
- 免费开源(MIT 协议),不挑设备,CPU 也能跑
顺带一提,它不只"转",还能把外语音频直接翻译成英文文本,这点后面会展开。
本地启动三步走
从克隆到第一条转写结果,整个过程不超过 10 分钟。
1. 拿到 Buzz
- 源码党:
git clone https://gitcode.com/GitHub_Trending/buz/buzz,再按仓库说明配置运行环境 - 嫌麻烦的用户:macOS/Windows 可直接下载打包安装包,Linux 有 Flatpak 和 Snap 渠道
- 命令行党:装好 ffmpeg 后用
pip install buzz-captions,再执行python -m buzz启动
2. 导入第一个音频
- 点工具栏的"+"或按 Ctrl/Cmd + O,选一个 MP3、WAV、MP4 之类的文件
- 选任务(转写/翻译成英文)、语言、模型,点 Run
- 首次使用会自动下载模型,之后换机器可以把模型缓存目录整个拷过去离线使用(详见 FAQ 文档)
3. 打开结果看效果
- 状态变"Completed"后双击该行,进入转写查看器
- 支持全文搜索、音频播放联动、倍速播放,定位某句话很方便
文件批量转录:队列 + 文件夹监控
如果你只打算用一个功能,大概率就是批量处理音频文件。
- 队列制:一次拖入多个文件,Buzz 按顺序排队处理,期间可以干别的
- 文件夹监控:设好目标文件夹,新丢进去的音频自动排队转写,适合固定工作流
- 支持直接粘贴 YouTube 链接转写,省掉单独下载音频这一步
- 每个任务的进度、状态在列表里实时可见,失败可单独重跑
实时录音转写与字幕导出
Buzz 不只是文件工具,麦克风模式才是它的高光。
实时转写:选好麦克风和语言后点 Record,说话的同时文字逐句上屏,还配一个独立的演示窗口,演讲、活动时投屏很实用。
字幕导出:转写完在查看器里点"Resize",可以把逐词时间轴合并成一行行字幕,设每条字幕的最大长度、是否按标点断句,还能给每条字幕加几秒停留时间,然后导出 SRT 或 VTT——本地字幕生成就是这么简单。
新手容易忽略的 4 个实用技巧 💡
- 模型别贪大:FAQ 里说得很直白——小模型快但错得多,大模型准但费时间。有 6GB 以上显存选 Faster Whisper,没有就 Whisper.cpp;不确定就各试一段自己的音频
- Initial prompt 防专名错拼:在"高级"设置里把人名、术语写进初始提示,识别错误能明显减少
- 语言建议手动指定:自动检测靠开头几秒猜,偶尔会翻车;知道语言就手动选
- 插件系统:内置 AI 摘要、说话人分离、说话人识别、自动调整字幕等插件,按需启用即可,源码在 plugins 目录
这三个场景基本覆盖日常
- 商务会议:会后把录音丢进监控文件夹,出门前文稿和纪要素材都已备好,全程不涉网
- 课程学习:课堂录音转成带时间戳的文字,双击某句话直接跳到音频对应位置
- 视频/播客:一次转写同时产出文稿(TXT)和字幕(SRT/VTT),省掉来回导字幕的功夫
常见问题,先给结论再解释
转得太慢怎么办?换更小的 Whisper 模型或改用 Whisper.cpp 后端(对集显友好);有 N 卡且显存 ≥6GB 优先 Faster Whisper。具体对比见 偏好设置文档。
自动检测语言结果不对?改成手动指定语言。检测逻辑只采样开头几秒,多语言混杂的音频尤其容易误判。
完全断网的电脑能用吗?能。先在联网机器上下载模型,通过"帮助→偏好设置→模型"里的"显示文件位置"找到缓存目录,整个拷到离线机器的相同位置即可,仓库里还附带了 模型批量下载脚本 方便备货。
一句话总结:Buzz 最适合"音频不能出内网、又要批量要字幕"的人。不妨先拿一段 5 分钟的录音跑一遍,看看速度和你能否接受,再决定要不要把它搬进日常工作流。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考