Buzz 本地语音转文字:装完 3 步出字幕,Whisper 离线转录免费用
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
一段两小时的课程录音躺在硬盘里,你要交一份带时间轴的字幕稿。丢给在线服务,要么排队等,要么担心录音内容出外网;手动逐句打又慢又累。Buzz 把这条流程搬回本地:音频进,文稿和字幕出,全程不联网,也不收订阅费。
项目定位
- 做什么:转写音频、视频文件和 YouTube 链接,支持中英等 99+ 种语言
- 不做什么:文件不上传任何服务器,不依赖在线订阅
- 核心卖点:本地离线转录,MIT 协议开源免费
- 导出 TXT、SRT、VTT 三种格式,字幕可直接进剪辑软件
- 麦克风实时转录,可切全屏演示窗口投给听众
- 多后端可选:NVIDIA 显卡 CUDA、Apple Silicon、集显 Vulkan
装完 3 步跑通
桌面版按平台装:macOS 下 .dmg 打开即用;Windows 装安装包,提示未签名时点"仍要运行";Linux 用sudo snap install buzz或 Flatpak 一行装好。想用命令行,先备好 Python 3.12 和 FFmpeg,再执行:
pip install buzz-captions python -m buzz打开后三步出第一条转录:
- 在模型设置里挑一个 Whisper 模型,第一次会自动下载,之后纯离线
- 把音频或视频拖进主界面,也支持粘贴 YouTube 链接,任务自动排队
- 点开始,表格实时显示进度,完成后转写文件自动落盘
全程无注册、无必填配置项,模型缓存在本机,第二次起不再重复拉取。
三个真实用法
批量处理一堆录音:十几个访谈或会议录音一次拖进去,依次排队,进度百分比一目了然。录音条件差,可勾选"转录前语音分离",嘈杂多人对话准确率更稳。
会议讲座实时转写:点麦克风开始边说边出字。中途想查一句原话,打开转写查看器搜关键词,拖进度条就能定位到那一秒。
给视频出字幕:视频走同样的转录流程,完成后进查看器逐句校对,改错字、微调时间戳。内置字幕调整把每条字幕压到目标长度、按间隔重新切分,符合播出习惯。
模型怎么选
| 模型 | 速度 | 精度 | 硬件门槛 |
|---|---|---|---|
| Tiny | 最快 | 低,适合草稿 | 几乎无要求 |
| Base | 快 | 日常够用 | 低 |
| Small | 中等 | 均衡 | 低 |
| Medium | 较慢 | 较好 | 中等 |
| Large | 最慢 | 最高 | 吃内存和算力 |
Turbo 在速度和精度之间取平衡。没有银弹,用你自己的语言各测一遍最准。
技巧与快问快答
- 录音条件差先降噪,或转录前开语音分离
- 用"初始提示"填入领域术语、人名,专业内容准确率更稳
- 开文件夹监控,把录音固定丢进某文件夹,新文件自动转录
- 长音频超一小时先分段,更稳不易中断
- 要批量自动化,用 CLI 直接跑脚本
Q:转录慢?换 Tiny/Base 小模型,或给 GPU 加速(CUDA / Vulkan / Apple Silicon)。Q:出现原文没有的"幻觉"词句?Large-V3 偶尔会编造,换 Large-V2 或 Turbo 试试。Q:小语种支持吗?Whisper 覆盖 99+ 种;Hugging Face 后端可选 Meta 的 MMS 模型族,覆盖 1000+ 种语言。
值得花十分钟试一次
拿一个真实、敏感或难处理的文件跑一遍,你就知道它合不合适。
官方文档见 docs/docs/,插件源码见 buzz/plugins/。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考