输入主题生成 AI 短视频:Pixelle-Video 数字人口播与全自动出片实战手册
2026/9/6 19:38:01 网站建设 项目流程

输入主题生成 AI 短视频:Pixelle-Video 数字人口播与全自动出片实战手册

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

Pixelle-Video 是一个开源的 AI 全自动短视频引擎:输入一个主题,它依次调用 LLM 写文案、图像模型出配图、TTS 合成语音、再叠加 BGM 渲染成完整视频,全程无需剪辑软件,也无需自己出镜。按文档口径,一条 5 分镜的视频从点击生成到出片约 2-5 分钟。它适合内容创作者、电商运营、教育机构和只想把想法变成成片的新手,本文按部署、配置、三条工作流的顺序讲清怎么用。

横屏电影感模板:深色底加居中画框,标题在上、解说着落在下,适合 B 站和 YouTube

能力总览

Web 界面以 Tab 形式提供三条流水线,共用同一套 LLM、图像、视频、TTS 服务,可在「系统配置」中随时替换:

模块支持内容
主题生成视频输入主题或粘贴固定文案,AI 完成分镜、配图、语音、合成
数字人口播上传人物照片(或商品图)生成口播视频,支持两种合成模式
图生视频上传首帧图,生成约 5 秒动态片段
动作迁移上传参考视频加人物图,迁移动作(扩展模块)
LLM通义千问、GPT、DeepSeek、Ollama 等任何 OpenAI 兼容接口
图像 / 视频本地 ComfyUI、云端 RunningHub,或直连 DashScope、OpenAI、Kling、Seedance
语音Edge-TTS 免费音色,或 Index-TTS 等工作流加参考音频做声音克隆
模板与尺寸templates/ 下 30 余种 HTML 模板,覆盖竖屏 1080x1920、横屏 1920x1080、方形 1080x1080

上手路径

1. 获取并启动 Web 界面

从源码启动只需两条命令,依赖由 uv 自动安装(macOS / Linux 需先装 ffmpeg):

git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video && uv run streamlit run web/app.py

Windows 用户建议直接用官方 Releases 的一键整合包:解压后双击start.bat,无需 Python 和 ffmpeg。启动后浏览器打开http://localhost:8501,云端部署也可以按 Dockerfile 和 docker-compose.yml 走容器方式。

水墨留白风格的横屏模板,顶部标题、底部解说,画面元素少,长文案可读性更好

2. 配置系统设置

首次进入页面展开「⚙️ 系统配置」,按三组填写并保存:

  • LLM:下拉选预设(通义千问性价比最高),填 API Key,本地模型填 Ollama 地址
  • ComfyUI / RunningHub:本地服务填comfyui_url(默认http://127.0.0.1:8188)并点「测试连接」;走云端则填 RunningHub API Key
  • API 媒体模型(可选):直连 DashScope、OpenAI、ARK、Kling 时填密钥和 Base URL,可单独开本地代理

只选 ComfyUI 或 RunningHub 工作流的话,第三组可以不填;选了api/...工作流则必填。

3. 选一条流水线试跑

默认在「快速生成」Tab:选「AI 生成内容」,输入主题(例如"为什么要养成阅读习惯"),分镜数保持 5,TTS 用默认 Edge-TTS,模板选竖屏image_default.html,点「生成视频」。右侧会实时显示进度:生成文案 → 逐分镜配图 → 合成语音 → 合成视频,完成后自动预览,文件落在output/目录。跑通这一条后,再切数字人口播和图生视频 Tab。

深入使用

三条核心工作流按「输入 → 配置 → 输出」拆解如下。

工作流一:主题生成短视频

  • 输入:一个主题词,或直接粘贴完整文案(「固定文案」模式跳过 LLM 创作,文案按段落、行或句子分割成分镜)
  • 配置:分镜数默认 5;BGM 可选无、内置或自定义(把 mp3 放进bgm/目录);图像工作流决定配图模型,「提示词前缀」用英文统一整片画风;模板决定布局和画幅
  • 输出:带解说的完整 mp4,每句文案对应一张 AI 配图,进度条按分镜计数

深色科技风左右分栏模板:左侧标题与解说、右侧 AI 生成的配图,适合专业讲解类数字人视频

工作流二:数字人口播

  • 输入:人物照片(jpg/png/webp)是必填项;「数字人」模式再加一张商品图和商品标题,「自定义」模式直接写口播文案
  • 配置:TTS 分本地(Edge-TTS 选音色、语速 0.5x-2.0x)和 ComfyUI 两种推理模式,后者可上传参考音频做声音克隆;合成服务可选 RunningHub、本地 ComfyUI 或直连 API 参考生视频模型(如 DashScope)
  • 输出:竖屏 9:16 口播视频。「数字人」模式走三步工作流:先合成人物加商品的推广画面、LLM 写 80 字以内推广文案、再合成音频;「自定义」模式直接用人物图加你写的文案。API 模式下会先出口播音频,再连同人物图、商品图一起送入视频模型,生成约 5 秒带原生语音的口播片段

工作流三:图生视频

  • 输入:首帧图片,支持多张批量
  • 配置:选 i2v 工作流,本地如 workflows/runninghub/i2v_LTX2.json,或 API 模式的已验证参考生视频模型
  • 输出:每张图生成约 5 秒的动态片段,首帧构图和色调保持不变,适合做封面动效或商品展示

方形 1080x1080 极简模板:细线画框居中构图,适配小红书等方形信息流

实战技巧

  • 用固定文案模式时,建议把完整解说词直接贴进去,避免每次生成都重新跑 LLM 导致文案漂移,也省一步 API 费用
  • 控制分镜数量时,建议 3-5 个就够用,5 分镜视频出片约 2-5 分钟,分镜越多耗时和费用线性增长
  • 统一配图风格时,建议把英文提示词写进「提示词前缀」(例如Minimalist black-and-white matchstick figure style illustration, clean lines),并先用「预览风格」试一张再批量生成
  • 做零成本方案时,建议 LLM 选 Ollama 本地模型、图像选selfhost/工作流,全程 0 元;无独立显卡就改用 RunningHub 跑图像,LLM 仍可用通义千问压低成本,混合部署随时可切
  • 批量出片时,建议把runninghub_concurrent_limit调大(1-10),默认 1 表示所有任务串行排队
  • 想用自己的声音时,建议切 TTS 的 ComfyUI 模式并上传 10 秒以上干净人声做参考音频,走 Index-TTS 工作流,生成前先用「预览语音」试听
  • 选输出尺寸时,建议按发布平台定画幅:竖屏 1080x1920 对应抖音、小红书、快手,横屏 1920x1080 对应 B 站和 YouTube,模板按尺寸分组,别选错组导致裁切

技术要点

  • pixelle_video/service.py:核心服务层,把 LLM、TTS、图像/视频生成、帧处理、合成封装成统一接口,Web UI 和 API 都从这里取能力
  • workflows/:ComfyUI 与直连 API 的工作流 JSON,按 runninghub、selfhost 分组,新增文件放入即被自动扫描
  • templates/:HTML 视频模板,按 1080x1920、1080x1080、1920x1080 三个尺寸分组,会随 README 持续新增

下一步可以先跑通「主题生成视频」的最小流程,再按需换模板、音色和工作流。遇到报错优先看 docs/zh/troubleshooting.md,模板和 API 细节在 docs/zh/user-guide/ 下按主题分类。

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询