Buzz 上手:5 步把长录音变成可导出的字幕
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
你有一段 90 分钟的录音要转成文字,还不想让它离开自己的电脑——Buzz 就是为这种情况做的本地语音转文字工具,底层是 OpenAI Whisper,转译、翻译、字幕导出全部离线完成。
全文按顺序走一遍:装好 → 转出第一段文字 → 挑模型 → 导出字幕 → 批量化,每一步都能独立落地。
Buzz 安装步骤与第一次转录操作
这一节能让你从零拿到第一段转译文本。装它几乎不用动脑,按你的环境对号入座:
| 你的环境 | 安装方式 |
|---|---|
| Windows / macOS | 下载官方安装包直接装 |
| Linux | Flatpak 或 Snap |
| 命令行用户 | pip install buzz-captions,再运行 python -m buzz |
装完打开主界面,第一次转录按这个顺序来:点左上角"+"导入音频或视频(MP3、WAV、MP4、AVI 都能收);任务选"转录";语言下拉框里手动指定;点"运行",等进度条走完。
文档里反复强调的一条经验:能手动选语言,就别依赖自动检测。带口音或背景嘈杂的录音,自动检测容易判断错,手动指定能省掉返工。想让专有名词、人名少出错,打开 Advanced 里的 Initial prompt,把相关术语预填进去,识别准确率会明显提升。
Buzz 模型怎么选:Tiny 到 Large 对照表
选模型只需要回答一个问题:要速度,还是要精度。Buzz 内置五档 Whisper 模型,体积和识别质量基本成反比:
| 模型 | 下载体积 | 相对速度 | 识别精度 |
|---|---|---|---|
| Tiny | 约 75MB | 飞快 | 够用 |
| Base | 约 142MB | 快 | 良好 |
| Small | 约 466MB | 一般 | 高 |
| Medium | 约 1.5GB | 偏慢 | 很高 |
| Large | 约 2.9GB | 最慢 | 顶级 |
日常随手转,Base 就够;做字幕上 Small;正式交付再开 Medium;说话人语言混杂的材料才值得上 Large。模型可以在设置里提前下载、集中管理,不用每次转录前现等。
用 NVIDIA 显卡或 Apple Silicon 的机器,记得在设置里打开加速:一小时的音频,处理时间能从半小时级压到几分钟。
Buzz 字幕导出:SRT 生成与 Resize 重排
转录不是终点,这一节讲怎么把一段文字变成能直接交付的字幕文件。
打开转录结果,是个带搜索、播放控制、语速调节的阅读器,长录音想定位某句话,搜一下或者快进就行。
要出字幕,转录前勾上"词级时间戳",结果就能存成 SRT、VTT 这类标准格式。接着用 Resize 功能,按标点、按单行最长时长、按静音间隔自动重排字幕行,断句不用一条一条手动拖。
做视频的可以把流程串起来:导入视频 → 生成带时间戳的字幕 → 一键翻译成目标语言 → 导出 SRT,全程不离开本机。
Buzz 批量转录与实时录音设置
单条录音跑通之后,下面几个玩法能明显改变使用节奏:
- 文件夹监控:指定一个目录,文件一丢进去就自动开转,批量处理很省心;
- 实时录音:接上麦克风边开会边出文字,配合演示窗口,投屏时可以直接当大字幕用;
- 插件系统:AI 摘要、DeepFilterNet 降噪、DOCX 导出、跳过已转录文件,都做成可开关的插件,按需启用;
- 命令行:把转录写进脚本,和文件夹监控搭配就是无人值守流程。
想继续深挖,仓库里的 docs/docs/ 有分步图文文档,插件的实现可以看 buzz/plugins/,Whisper 后端的接入逻辑在 buzz/transcriber/。
我的建议:先装完默认配置,找一段两三分钟的录音把"导入 → 转录 → 导出 SRT"完整跑一遍,确认字幕没问题,再回头去挑模型、开监控、装插件。🔧
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考