从0到成片:Pixelle-Video 数字人口播视频的3步实操教程
2026/9/4 14:01:17 网站建设 项目流程

从0到成片:Pixelle-Video 数字人口播视频的3步实操教程

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

给产品录一段讲解视频,又不想真人出镜,还要兼顾配音和画面设计——这是不少卖家和内容团队常遇到的麻烦。开源项目 Pixelle-Video 把这条链路做成了一个 AI 全自动短视频引擎:只需上传一张人物照片,再给出商品标题和卖点,配图、口播稿、配音和成片会依次自动生成。

它的定位是数字人口播视频制作工具,也兼顾图文短视频场景。适合电商运营、课程讲师和新号博主:不想搭拍摄场地、不打算请配音员,希望从主题到成片全程自动化。核心能力是把"数字人形象+商品素材+一段主题"交给 AI 数字人视频生成流程,最后拿回一段 9:16 竖屏口播视频。

能力速览:什么人用起来顺手

做带货短视频的电商卖家。痛点是出镜成本高、迭代慢。只给商品标题和一张图就能出片,AI 会自行撰写 80 字以内的推广文案,再合成口播画面,一条视频不满意就多跑几条挑最好的。

做知识分享的课程讲师。痛点是录屏剪辑耗时。输入课程要点即可生成讲解视频,本地 Edge-TTS 支持中英等语言音色,还能换工作流做参考音频声音克隆。

运营多个账号的新媒体人。痛点是风格统一难。画面版式由 HTML 模板控制,竖屏、横屏、方屏都有现成样式,模板变量可动态填充内容,方便批量产出。

上手路径:3步生成第一条数字人视频

第1步 环境准备:装好依赖,跑起网页界面

数字人口播视频制作教程里最常被问的是依赖项,这里列全:Python、uv 包管理器、ffmpeg;后端二选一,本机 ComfyUI 或 RunningHub 云。拿到代码的方式如下:

git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video

把 config.example.yaml 复制为 config.yaml,填入 LLM 的 api_key、base_url、model(支持任意 OpenAI 兼容接口,Ollama 本地模型也可),以及 comfyui 段的 comfyui_url 或 runninghub_api_key。然后在仓库根目录运行uv run streamlit run web/app.py,浏览器打开 http://localhost:8501,左侧选择数字人口播流水线即可进入操作页,实现见 web/pipelines/digital_human.py。

第2步 素材与参数:上传形象,选对生成模式

操作页从左到右分三栏。左栏上传数字人形象图片(JPG / PNG / WebP),下方是商品图片和信息:选"智能带货"模式时填商品标题,系统会代写口播文案;选"自定义口播"则直接粘贴完整文案,两种方式填一个即可,都填时以文案为准。中栏确定两个服务的来源——前置图片生成与口播视频合成,各可选 RunningHub、selfhost 或直连 API 三种,再从中挑选具体工作流。右栏汇总参数并放生成按钮。

第3步 生成与导出:看进度,拿成片

点"生成"后系统先校验配置和素材是否齐全,然后依次执行:合成人物与商品的配图、撰写口播稿、TTS 配音、驱动数字人说话并合成 final.mp4。进度条和状态文字实时刷新,文案、配音、合成各阶段一目了然。完成后页面内嵌播放器可直接预览,下方提供下载按钮。

个性化配置:换音色与换模板的设置位置

想换音色去哪改

本地 Edge-TTS 的音色清单在 pixelle_video/tts_voices.py 的 EDGE_TTS_VOICES 里维护,常用几组如下:

分组音色 ID适配合成场景
中文女声zh-CN-XiaoxiaoNeural、zh-CN-XiaoyiNeural带货种草、日常分享
中文男声zh-CN-YunjianNeural、zh-CN-YunxiNeural、zh-CN-YunyangNeural产品讲解、知识科普
英文en-US-JennyNeural、en-US-AriaNeural出海内容

语速在同一面板滑条调节;换成 ComfyUI TTS 工作流(如 tts_edge、tts_index2)后可以上传参考音频做声音克隆,工作流文件在 workflows/ 目录下。

想换风格模板怎么办

模板按尺寸分文件夹存放:templates/1080x1920/、1080x1080、1920x1080。文件命名前缀决定素材形态——static_ 为纯静态版式,image_ 需要 AI 生成图片,video_ 需要 AI 生成视频;想固定默认样式,改 config.example.yaml 里 template.default_template 的值即可。

想改生成逻辑改哪里

数字人流程由三个工作流 JSON 串联:workflows/runninghub/digital_image.json 合成"人物+商品"配图、workflows/runninghub/digital_combination.json 驱动口播、workflows/runninghub/digital_customize.json 负责定制模式;selfhost 同名文件供本机 ComfyUI 使用。config.yaml 中 comfyui.image / comfyui.video 的 prompt_prefix 可加全局风格前缀;有二次开发需求时,API 路由在 api/routers/ 下按资源拆分子模块,可据此扩展接口。

避坑清单:数字人视频生成失败排查

生成按钮置灰。排查:界面信息提示通常写明缺什么——形象图片、商品图片或文案/主题。解决:补齐对应项;智能带货模式下商品标题和口播文案至少填一个。

界面提示"尚未完成配置"。排查:config.yaml 里 LLM 的 api_key / base_url / model 是否留空,所选服务来源的密钥是否填写。解决:补齐后刷新页面再试。

出现 RunningHub / selfhost 未配置警告。排查:comfyui 段对应字段缺失,或服务未启动、网络不通。解决:填写 runninghub_api_key 或本机 comfyui_url(Docker 环境记得改用 host.docker.internal),确认服务可访问。

文案和主题同时填写后画面不对口。排查:系统优先采用所填口播文案,不再参考 AI 主题。解决:二选一填写,避免互相干扰。

生成太慢。排查:文案长度、分辨率、分镜数量、后端排队。解决:压缩文案、降低生成分辨率、减少分镜,条件允许时改用 Ollama 本地 LLM 与本机 ComfyUI,把调用开销留在自己机器上。


Pixelle-Video 把数字人口播拆成了"上传素材—配置服务—点生成"三条动线,上手门槛并不高。接下来可以打开网页界面,先跑通一条 80 字文案的竖屏口播,再按上面的小节逐项替换音色和模板。

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询