用文本编辑剪视频:AutoCut 离线 Whisper 转录加 3 条命令完成剪辑的完整指南
【免费下载链接】autocut用文本编辑器剪视频项目地址: https://gitcode.com/GitHub_Trending/au/autocut
上周三晚上 11 点,阿哲盯着 OBS 导出的一个 47 分钟课程录屏发呆。开头 8 分钟的调设备、中间至少 10 处"嗯,我们刚才讲到哪儿了",他得把这些全部清掉。按老办法,他要在剪辑软件里拖时间轴、逐句听、手动打点,一晚上未必干完。后来他试了一个思路:让程序先把整段话转成带时间戳的字幕,自己只在文本里把要留的句子勾上,剩下的交给程序去剪——这个工具叫 AutoCut,一次跑下来,他省了大概 6 个小时。
🧭 AutoCut 是什么:把剪辑变成改文本的开源工具
AutoCut 是一个开源的命令行视频剪辑工具,核心思路只有一句话:先用 Whisper 把视频语音转成字幕,你像改文档一样编辑 Markdown,把要保留的句子勾上,它再自动剪出对应的片段并合成成片,全程不打开任何视频编辑软件。适合课程录屏、播客、会议录像这类"内容长、废话多"的素材,使用者只需要会打字。它和传统剪辑工具最大的差异,是把"在时间轴上找剪切点"换成了"在句子上打勾"——原来要在时间轴上对 20 分钟的剪辑点,现在勾 5 个复选框就行。
🎬 一次完整实操:从录屏到成片
先把工具装好,这条命令克隆仓库并装进当前 Python 环境,同时装好 ffmpeg 作为音视频处理底座:
git clone https://gitcode.com/GitHub_Trending/au/autocut cd autocut && pip install .ffmpeg 没有的话,Linux 用包管理器、macOS 用 brew、Windows 用 scoop 装一个即可。
装好后跑一下这条命令,把录屏丢进去让它转:
autocut -t lecture.mp4等几分钟,同目录下会多出lecture.srt和lecture.md两个文件。md 文件里每句话前面都带一个复选框,开头有一句 "Mark if you are done editing."——把要保留的句子勾上,最后这句也勾上,保存。然后跑剪辑命令:
autocut -c lecture.mp4 lecture.srt lecture.md得到lecture_cut.mp4,只包含勾选过的片段,还会附一份剪完之后的lecture_cut.md字幕供核对。如果手里只有一个现成的 srt 文件,也可以直接编辑 srt 删掉不要的行再剪,md 并非必需。
🎛️ 三个核心能力拆解
离线 Whisper 转录
它能做什么:视频、音频都能转,默认在本地跑 Whisper 的 small 模型,配了 Silero VAD 先把有声段找出来再送进模型,省算力也降噪;语言默认中文,--lang en等参数可切其他语种。对你意味着什么:素材不用出机器,断网也能转,且不用为"哪段是人声"操心。典型用法:
autocut -t podcast.mp3 --lang en --whisper-model base模型从 tiny 到 large 任选,也可以改用--whisper-mode=openai调 OpenAI 的接口,或--whisper-mode=faster走 faster-whisper,机器没有 GPU 时这三条路各取所需。
| 模型 | 相对速度 | 转写质量 | 适用场景 |
|---|---|---|---|
| tiny / base | 快 | 一般 | 草稿、快速预览 |
| small(默认) | 中 | 较好 | 日常素材 |
| medium / large | 慢 | 好 | 正式交付、术语多 |
用 Markdown 勾选句子来剪辑
它能做什么:按勾选项对应的字幕行取时间戳,相邻句子间隔小于 0.5 秒会自动合并进同一片段,避免剪出碎得听不下去的结果;输出默认 10m 码率的 mp4,音频同步重采样并做响度归一。对你意味着什么:剪辑决策变成了阅读和勾选,剪完还能拿lecture_cut.md逐句复核有没有多剪漏剪。典型用法就是上面那条-c命令;文件已存在想重剪时加--force,想压体积就加--bitrate 5m。
文件夹监控批量处理
它能做什么:-d指向一个目录后持续值守,新落盘的媒体文件自动转录,发现 md 被标记"done editing"就自动剪出_cut.mp4;目录里所有片段剪完后,它还会生成autocut.md,把各文件列成清单等你勾选,勾完即合并出autocut_merged.mp4。对你意味着什么:可以按录制日期建文件夹,录完就扔进去,下班前勾一轮,成片自己出来。典型用法:
autocut -d ./my_videos -t -c配合 OBS 的文件名格式(设置里的"文件名格式"加一段日期路径),文件夹天然按天分组,管理成本几乎为零。
🛠️ 实战配方
课程录屏去口水
痛点:每节课都有大段调设备、跑题、重复,逐条剪到天亮。 解法:-d监控当日录制目录,转录完打开 md,勾正文句子、勾 done,回目录拿_cut.mp4,一天多节课自动跑完。
术语密集的发布会视频
痛点:专有名词、人名被 Whisper 转成一堆音近字,字幕没法用。 解法:上更大模型,并用--prompt把关键词喂给模型做初始提示,--vad 1强制开语音活动检测,转写准确率立竿见影。
播客录音只要干净的文字文件
痛点:两小时对谈要拿去写文稿,但剪视频那套参数用不上。 解法:输入直接给 mp3,转录后剪出的产物就是 mp3,md 里照常勾选,文字和音频一起瘦身。
🩺 避坑与调优
症状:字幕或 md 里中文全是乱码。 原因:文件按 GBK 之类编码生成,而工具默认按 UTF-8 读写。 命令:autocut -t video.mp4 --encoding gbk(剪辑时同样带上该参数)。
症状:转录结果不准、口水句识别得乱七八糟。 原因:默认 small 模型对术语和嘈杂环境不敏感。 命令:autocut -t video.mp4 --whisper-model medium --prompt "专有名词:AutoCut, Whisper" --vad 1。
症状:跑一个视频要等十几分钟,速度让人怀疑人生。 原因:首次运行会下载模型,且默认自动选 GPU,没配好时实际落在 CPU 上。 命令:autocut -t video.mp4 --whisper-model base --device cuda(确认显卡可用时),显存不够就改--device cpu并把模型降档。
🚪 延伸入口
参数都在 autocut/main.py 里可查,完整说明跑autocut --help;转写在 autocut/transcribe.py,剪辑与合并在 autocut/cut.py,文件夹监控在 autocut/daemon.py。README 另有 Docker 构建方式(CPU 版用 Dockerfile,CUDA 版用 Dockerfile.cuda);想在 Python 里集成转录,直接from autocut import Transcribe, load_audio。
拿你手边任意一段会议录像跑一遍:转录、勾几个句子、剪出来,看看成片和你预期差多少。
【免费下载链接】autocut用文本编辑器剪视频项目地址: https://gitcode.com/GitHub_Trending/au/autocut
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考