Pixelle-Video 上手指南:从一句话到 AI 短视频成片,需要几步?
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
周五下午四点,市场负责人在群里弹出一句话:"今天六点前,要一条15秒的产品介绍视频。"搁过去,这意味着找剪辑师,或者熬夜拖时间轴。现在可以打开 Pixelle-Video——这款 AI 短视频生成引擎,输入一句主题,它会自动完成文案、AI 配图、配音和合成,把成片递到你手上,全程不碰剪辑软件。
跑通一次:从空目录到成片
先别急着读文档,直接跑。
第一步,克隆仓库、装依赖。项目用 uv 管理,Python 3.11 以上即可:
git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video uv sync没有 uv 的话,官方文档里有两行安装命令;用虚拟环境 pip install -e . 也可以,效果一样。
第二步,配一个 API Key。把 config.example.yaml 复制为同目录下的 config.yaml,填上 llm 部分。新手建议先用通义千问,一条成片几毛钱;有本地 GPU 的可以指向 Ollama,零成本:
llm: api_key: "your-api-key" base_url: "https://dashscope.aliyuncs.com/compatible-mode/v1" model: "qwen-max"生图、生视频的 backend 有三种走法:
| 生图/生视频后端 | 前置条件 | 费用 |
|---|---|---|
| RunningHub 云端工作流 | 填一个 API Key | 按量计费 |
| 本地 ComfyUI | N 卡 + 下载模型 | 0 元 |
| 直连图像/视频 API | 对应供应商 Key | 按调用计费 |
拿不准就选默认的 RunningHub 工作流,开箱即用。
第三步,启动网页。执行bash start_web.sh(Windows 用户用 start_web.bat 或整合包),浏览器打开 localhost:8501,界面分三栏:左边输主题,中间配语音和视觉,右边看预览和进度。
第四步,输主题、点生成。内容输入里填"为什么要养成阅读习惯",分镜数保持默认 5,等上两到五分钟,右侧自动播放成片,文件落在 output/ 目录。
黑底、水墨风 AI 配图、标题和文案排版清楚,这套横屏电影感模板就是"能直接交差"的样子。回头看,那条15秒视频,确实就是一句话的事。
先划清边界:它能干和不能干什么
亲眼看到效果了,再把边界说清楚。它擅长的是把"一个话题"变成"一条片子",另一件事就别指望太多:
- 能:输入主题,自动跑完文案、AI 配图、TTS、视频合成四步,成片直接落盘,这是它一句话生成视频的核心
- 能:31 个模板覆盖竖屏、横屏、方形三种画幅,界面和口播都支持中英文
- 能:换任意部件——LLM、图像模型、视频模型、TTS 引擎各换一个,甚至拿自画的 ComfyUI 工作流接管整个流程
- 不能:剪辑你已有的素材。它只从零生成,不做二次剪辑
最后一条决定适用场景:素材要是实拍(真人出镜、产品演示),它不是对的工具;任务要是"给一个话题做一条风格统一的片子",就是它的舞台。它不替代专业剪辑师,只是帮你干掉前 80% 的重复劳动。
跑通之后,试这三种玩法
模板决定视频的"皮",templates/ 按画幅分目录存放。先试这三个场景,各配一个模板和一个值得动的参数。
给知识课账号配一条讲解视频
主题示例:"勾股定理在初中的三个应用场景"。
为什么选 image_book.html(横屏):白底、浅水墨插画、文字区域大,是"课件幻灯片"的观感。课程类内容信息密度高,模板就得克制,把空间留给字。
值得调的参数:分镜数。课程干货多,但前15秒的钩子用 3 帧就够——开头提问、一个知识点、结尾悬念,展开留到下一条。
给新品做一支种草短视频
主题示例:"智能手表的十大实用功能"——直接把卖点塞进主题,LLM 会自己组织表达结构。
为什么选 image_wide_darktech.html(横屏):左文右图、蓝紫渐变背景,自带科技发布会气质。image_modern 偏街头潮流,darktech 偏硬核科技,卖硬件选后者更贴。
值得调的参数:图像的 prompt_prefix。这个前缀会拼进每一句 AI 配图提示词,加一句"产品摄影、影棚灯光",所有分镜的 AI 配图风格就统一了。
把长内容拆成方形图文卡
主题示例:"视频开头3秒的心理学"。
为什么选 image_minimal_framed.html(方形):方形视频常发在社交主页流,这个模板是纯白底加细线画框,AI 配图当绝对主角,安静得像知识卡片。
值得调的参数:背景音乐。默认 BGM 放在 bgm/ 目录,方形知识类内容可以换一首能量更低的,甚至静音只留人声——信息密度高的片子,声音要安静。
更多预览可以看 templates/1920x1080/ 目录,也可以直接在网页里逐个预览。不过继续深挖之前,先绕开新手最常踩的四个坑。
新手容易踩的坑,和绕过去的方法
坑一:点完生成,卡很久,最后超时。
现象是进度条停在"生成配图"一步。原因是你选的自托管工作流,背后要求本地 ComfyUI 正跑在 127.0.0.1:8188 上,Docker 用户还要把地址换成 host.docker.internal。解法:新手直接用默认的 RunningHub 云端工作流,不搭本地环境,一个 API Key 走天下。
坑二:AI 配图和文案对不上。
某帧在讲"光合作用",图生成了一座山。原因是主题太泛,分镜的图像提示词很简短,模型只能自由发挥。解法是把主题写具体,"光合作用的过程与意义"好过"光合作用";主题里带上具体视觉元素,文案和配图才绑得住。
坑三:成片太长,塞不进15秒的档口。
你要15秒,它给你40秒。原因是默认 5 个分镜,每句口播的长短由 LLM 自由决定。解法是拧两个旋钮:分镜数调成 3,再在主题里写明"每帧口播不超过15字"。前者控帧数,后者控单帧时长。
坑四:人声像火车站播报,BGM 还压过声音。
原因是默认 Edge-TTS 音色追求的是"能听清",不是"有味道"。解法:语音设置里上传一段参考音频做音色克隆,气质立刻接近真人;BGM 太大声,就把 bgm/ 里的文件换成能量更低的版本。
这四个坑绕过去,剩下的就只是熟练度的问题了。
开始你的第一条片子
三件事,今天就可以做完:
- 克隆仓库、uv sync,在 config.yaml 里填一个 LLM API Key
bash start_web.sh,输入主题,点生成- 到 output/ 里看第一条成片,不满意就换模板或换主题再跑一次
中途卡住,先翻 docs/zh/ 的中文文档——多数问题出在配置,而不是模型。
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考