JeecgBoot AI专题研究| 从短视频流水线到多智能体短剧导演,两款开源 AI 视频框架的原理拆解、部署配置与避坑清单
为什么"做一条视频"仍然这么难
如果你做过知识口播、短剧或者带货短视频,应该对这样一张时间表不陌生:写脚本一小时、找素材一小时、配图配音再一小时,剪辑合成又是一小时——一条三分钟的视频,半天就没了。想日更?基本只能靠外包,而配音、美工、剪辑各收一份钱,单条成本从几十到几百元不等。更多人卡在第三道坎上:有想法,但不会剪辑软件、不懂调音、也没有绘画功底。
过去两年 AI 工具确实很多,但大多数只解决"一个环节":这个能文生图,那个能配音,另一个能出几秒视频片段。环节之间的衔接仍然要靠人,一旦视频拉长,人物换脸、场景穿帮、剧情接不上等问题就会集中爆发。
真正有价值的,是把文案 → 分镜 → 画面 → 配音 → 配乐 → 合成整条链路串起来的"流水线"。本文要拆解的两个开源项目正是这个思路:
- Pixelle-Video:阿里国际数字商业集团 AIDC-AI 团队开源,主打"输入一个主题,全自动出短视频";
- VideoClaw:哈工大(深圳)张民团队联合阿里打造,用多智能体模拟一个剧组,专攻长视频和连续剧情短剧。
一个偏"量产短平快",一个偏"长线讲故事",正好覆盖了 AI 视频创作的两端。
先看热度:一条陡峭的 Star 曲线
Pixelle-Video 在 GitHub 上的增长非常能说明问题:前期长时间平缓,进入 2026 年春季后突然拉出一条接近垂直的曲线,目前仓库 Star 数已达 27.6k,最新版本迭代到 v0.1.15,协议为 Apache-2.0(允许商用和二次开发)。
这种曲线通常意味着两件事:一是项目踩中了真实需求,二是上手门槛足够低,能被非技术用户自发传播。从仓库结构也能看出它的工程化程度——api、web、workflows、templates、bgm、Docker 配置一应俱全,还提供了 Windows 打包产物。
两种思路:流水线 vs 数字化剧组
两者都属于"第二代" AI 视频创作框架,底层技术栈高度相似:大语言模型负责写和拆,ComfyUI 工作流负责出画面,TTS 负责出声音,最后用 FFmpeg 合成。差别在于如何组织这些能力。
Pixelle-Video:一条无人值守的短视频流水线
它的设计目标是"全程零人工"。你只需要给一个主题,系统会依次完成:
- 大语言模型(DeepSeek、通义千问、GPT、Ollama 本地模型均可)根据主题写文案,并按镜头逻辑切成分镜;
- 每个分镜交给 ComfyUI,生成对应的图片或视频片段;
- Edge-TTS、Index-TTS 等语音模型生成口播配音;
- 挂载本地 BGM、自动加字幕,最终输出 MP4。
整个流程可以概括为:文案生成 → 配图规划 → 逐帧处理 → 视频合成,每个环节都能替换成不同的模型、音频引擎和视觉风格。它最擅长知识科普、情感口播、图文轮播这类几十秒到三分钟的内容。
VideoClaw:把长视频交给一支 AI 剧组
长视频的难点从来不在"生成一个镜头",而在几十个镜头之间保持一致。VideoClaw 的做法不是做一个更强的黑盒,而是把创作拆成一组可查看、可修改、可回溯的智能体:
| 角色 | 职责 |
|---|---|
| 编剧智能体 | 把一句灵感或故事梗概扩写成完整剧本 |
| 美术智能体 | 统一角色形象、场景与道具风格 |
| 分镜 & 关键帧智能体 | 规划镜头语言,绘制关键画面 |
| 视频生成智能体 | 分段生成视频片段 |
| 音频 & 合成智能体 | 配音、配乐与后期拼接 |
它真正的"杀手锏"有两个:
- 场记状态库:像真实剧组的场记一样,持续记录角色、场景、剧情状态,后续镜头都以此为依据,从根上缓解人物变脸、场景跳戏的问题,也让剧情可以无限续写;
- VLM 闭环质检:用视觉语言模型审核生成的画面和剧情,不合格片段自动回退重生成。
项目背后有 FilmAgent、Anim-Director 等前作积累,团队已有多篇 SIGGRAPH/ACL 论文,学术底子相当扎实。除了 WebUI,它还能接入微信、飞书等办公软件进行团队协作。
实际能做出什么效果
光看原理不够直观,Pixelle-Video 的 WebUI 把"文案、配音、BGM、分镜模板、画面风格"都放在一个页面里,左边填参数,右边直接预览成片:
新版本还扩展了数字人口播、图生视频、动作迁移等模块:
竖屏模板覆盖人文纪实、文化解构、科学思辨等方向,适合抖音、视频号:
配合声音克隆、自定义脚本和不同的生图模型,情感类、小说解说类、知识科普类也都有现成范例:
横屏方面则提供了电影模板和自定义模板,适合 B 站等平台的副业、历史解说类内容:
怎么选:一张对比表看清差异
| 对比维度 | Pixelle-Video | VideoClaw |
|---|---|---|
| 主打场景 | 短视频、口播、科普、图文轮播(几十秒 ~ 3 分钟) | 剧情短剧、影视二创、长篇漫剧(3 分钟以上,可无限续写) |
| 操作难度 | 极低,一键生成 | 中等,支持逐环节精修 |
| 部署难度 | Windows 一键包零技术;其他系统简单 | 标准代码部署 |
| 核心优势 | 批量效率高、模板多、上手快 | 长视频一致性强、流程可控、专业度高 |
| 成本消耗 | 只调用 LLM / 文生图 API,费用低 | 分段生成 + 质检,API 消耗略高 |
| 适合人群 | 自媒体新手、副业创作者、日更账号 | 短剧创作者、二创博主、专业内容团队 |
我的建议是:新手先用 Pixelle-Video 跑通"AI 视频生成"的完整逻辑,再去碰 VideoClaw 做长剧情。前者能帮你快速建立"分镜数、风格前缀、成本"之间的直觉,这些经验在后者里同样适用。
Pixelle-Video 部署:三种方式任选
开始之前的通用准备(源码部署必看;Windows 一键包已内置 FFmpeg,可跳过):
- 网络:调用云端 API 需要联网,纯本地 ComfyUI 可离线;
- FFmpeg:视频合成的核心依赖,缺了会直接报错;
- 账号:准备一个大模型 API(DeepSeek、通义千问都行,DeepSeek 充值 1 元就能用很久),以及本地或云端的 ComfyUI。
方式一:Windows 一键整合包(最推荐新手)
- 从 GitHub Releases 下载最新整合包:https://github.com/AIDC-AI/Pixelle-Video/releases/latest
- 解压到纯英文路径——中文路径是旧版启动失败的头号原因;
- 双击
start.bat,按提示输入邮箱(仅用于统计,不会扣费); - 浏览器会自动打开 WebUI:
http://localhost:8501。
整合包自带 Python 与 FFmpeg 运行环境,v0.1.10 之后也修复了早期启动闪退的问题。
方式二:macOS / Linux 源码部署
需要 Python 3.10+,官方推荐用 uv 管理依赖,比 pip 更快也更少冲突。先装 FFmpeg:
# macOSbrewinstallffmpeg# Ubuntu / Debiansudoapt-getinstallffmpeg# 验证ffmpeg-version克隆项目:
gitclone https://github.com/AIDC-AI/Pixelle-Video.gitcdPixelle-Video安装 uv 并同步依赖:
curl-LsSfhttps://astral.sh/uv/install.sh|shuvsync启动 Web 界面:
uv run streamlit run web/app.py浏览器访问http://localhost:8501即可。
方式三:Docker(服务器 / 批量运维)
docker-composeup一条命令拉起,不需要额外配置运行环境,适合放在服务器上长期跑批量任务。
WebUI 关键配置:两块缺一不可
左侧:语言大模型(负责写文案)
可选 DeepSeek、豆包、通义千问,或者 Ollama 本地模型(零 API 费用)。选中模型后填入 API Key 和接口地址即可。国内网络环境下优先选国产模型,能少踩很多"连不上"的坑。
右侧:ComfyUI(负责出画面)
方案 A:本地部署——适合有 NVIDIA 显卡(显存 ≥ 6GB)的用户,零云端费用:
gitclone https://github.com/comfyanonymous/ComfyUI.git进入目录后执行pip install -r requirements.txt安装依赖,再python main.py启动,把默认地址http://127.0.0.1:8188填回 Pixelle-Video 即可。
方案 B:云端 API——没有显卡就选这个,在合作的线上 ComfyUI 平台注册并填入 API Key。注意文生图的 token 单价明显高于大模型,建议先小额充值试跑。
让成片更好看的几个参数
- 分镜数量:越多画面越丰富,但 API 消耗也线性上涨,新手建议 5~8 个先试水;
- 分镜类型(成本由低到高):纯文字 → 图片轮播 → 视频镜头,按预算选择;
- BGM:工具不会自动生成音乐,需要把 MP3 放进程序目录下的
bgm文件夹,再在界面里选择; - 配音:优先用内置免费 TTS 音色,不建议走 ComfyUI 合成配音,额外扣费且性价比不高;
- 画面风格:在"提示词前缀"里定义风格(二次元、写实、水彩……),最好写成英文,模型理解更准确;不必描述具体画面,AI 会结合分镜自动补全。
VideoClaw 部署与基本用法
gitclone https://github.com/HITsz-TMG/VideoClawcdVideoClaw# 安装依赖(参照官方 requirements.txt)pipinstall-rrequirements.txt# 启动服务,访问本地 WebUI上手流程大致是:
- 输入一句故事灵感,比如"程序员被裁员后创业,最终收购了原公司";
- 系统自动生成剧本、角色设定和分镜,每一步都可以手动改;
- 保持 VLM 质检开启(默认开启,强烈建议别关),等待分段生成;
- 成片后可以点"剧情续写",让故事继续往下走。
踩坑清单:高频问题与解法
| 问题 | 常见原因 | 解决办法 |
|---|---|---|
启动报FFmpeg not found | 源码部署未装 FFmpeg 或没加环境变量 | 安装 FFmpeg,把bin目录加入 Path 后重启终端 |
| Windows 一键包闪退 | 路径含中文/特殊字符;杀毒软件拦截 | 换纯英文路径;把目录加入信任名单 |
| API 配好了却不出文案/画面 | Key 错误或欠费;接口地址填错;访问不了境外接口 | 核对 Key 和地址、查余额,优先用国内模型 |
| 本地 ComfyUI 连不上 | ComfyUI 没起来或 8188 端口被占 | 浏览器访问127.0.0.1:8188确认,释放端口 |
| 画面闪烁、人物变形 | 生图模型精度不够、风格不统一 | 换更高精度模型,统一提示词前缀,降低镜头切换频率 |
| VideoClaw 长视频剧情断层 | 关闭了场记库或质检;前期设定太粗 | 两个开关保持开启,角色/场景设定尽量写细 |
另外一个常被问到的问题:**没有独立显卡能用吗?**可以。文案、配音、合成都跑在 CPU 上,画面生成交给云端 ComfyUI API 就行。
写在最后:AI 视频工具的"可控性"才是长期价值
对比市面上的商用 SaaS,这两个项目最打动我的不是"一键出片",而是开源 + 本地部署 + 每个环节可替换:数据留在本机,模型可以随时换成更便宜或更强的,流程也能按团队习惯二次开发。
这与我们在 JeecgBoot 低代码平台上做 AI 能力集成时的体会一致——真正能落地到业务里的 AI,一定是可编排、可干预、可审计的流水线,而不是一个无法解释的黑盒。VideoClaw 的"场记库 + 质检回退",本质上就是把工程里的状态管理和自动化测试搬进了内容创作。
总结
- Pixelle-Video:一句话主题全自动出短视频,Windows 一键包零门槛,适合日更账号、知识科普和副业批量生产;
- VideoClaw:多智能体剧组 + 场记状态库 + VLM 质检,适合剧情短剧、影视二创和长篇漫剧;
- 两者都可以搭配剪映这类轻量工具做最后的微调;建议先用 Pixelle-Video 熟悉 AI 视频生产逻辑,再进阶到 VideoClaw。
项目地址:
- Pixelle-Video:https://github.com/AIDC-AI/Pixelle-Video
- VideoClaw:https://github.com/HITsz-TMG/VideoClaw
本文为 JeecgBoot AI 专题研究系列文章。