lanshu-create-ai-presenter-video快速上手教程:5分钟装进Claude Code或Codex,做出你的第一条数字人口播视频
【免费下载链接】lanshu-create-ai-presenter-videoProvider-neutral Codex Skill for producing verified AI presenter videos from a script and an authorized presenter image.项目地址: https://gitcode.com/gh_mirrors/la/lanshu-create-ai-presenter-video
lanshu-create-ai-presenter-video是一个开源的AI 数字人口播视频生成工具(Agent Skill):你只需给出一个主题或一段文案,再加一张已授权的真人照片,它就能带着 Claude Code、Codex 等 AI 编程助手,自动完成写稿、配音、数字人生成、口型同步、字幕、渲染与质量验收,最终交付一条可直接发布的讲解视频。本教程将带你在 5 分钟内完成安装,并做出第一条数字人口播视频。
先搞懂:它能做的两条路线 🎬
这个项目提供两种成片方式,agent 会根据你的描述自动判断该走哪条:
| 路线 | 成片效果 | 你需要提供 | 付费生成 | 画幅 |
|---|---|---|---|---|
| 数字人口播 | 数字人出镜讲解,字幕和关键词动效辅助 | 主题或文案 + 一张授权人物图 | 配音 + 数字人视频 | 任意,默认 9:16 竖屏 |
| 风格化讲解 | 不用真人:每句话都用画面“演”出来,9 种视觉风格可选 | 主题或文案(也可自带配音) | 只有配音 | 16:9 横屏 |
风格化路线内置了 9 种视觉风格:设计师留白、科技感信号、手账手绘、纸艺立体书、波普漫画、3D 一镜到底、图纸与注脚、黑板报、黏土小城。下图是仓库自带的 KV cache 讲解片在九种风格中的同一时刻效果:
安装前环境清单 ✅
| 依赖 | 说明 |
|---|---|
| 一个 coding agent | Claude Code、Codex、Gemini CLI、Cursor 等支持 Agent Skills 的工具均可 |
| Python 3.9+ / FFmpeg / Bash / jq | 本地基础环境 |
| 数字人路线 | 至少一种可调用的配音、数字人视频生成与口型同步能力(云 CLI、API 或本地模型) |
| 风格化路线 | Node.js、rsync、带numpy的 Python,以及 MiniMax API Key(或你自己录好的配音) |
5分钟安装步骤:装进 Claude Code 或 Codex
整个安装就是一条 clone 命令——仓库目录本身就是 Skill,克隆到对应 skills 目录即可(目录名需保持为lanshu-create-ai-presenter-video):
# Claude Code git clone https://gitcode.com/gh_mirrors/la/lanshu-create-ai-presenter-video.git \ ~/.claude/skills/lanshu-create-ai-presenter-video| 工具 | Skills 目录 | 显式调用方式 |
|---|---|---|
| Claude Code | ~/.claude/skills/(或项目内.claude/skills/) | /lanshu-create-ai-presenter-video |
| Codex | ~/.codex/skills/ | $lanshu-create-ai-presenter-video |
| 其他 Agent Skills 客户端 | 见各自文档 | 按客户端方式 |
安装完成后,在目录里执行git pull即可更新。如果多个工具共用,各克隆一份即可。
💡你的 agent 不支持 Agent Skills?把仓库克隆到任意位置,在对话开头说:「先阅读
lanshu-create-ai-presenter-video/SKILL.md,并严格按其中的流程工作」,任何能读文件、跑命令的 agent 都能照做。
三步做出第一条数字人口播视频 🚀
第 1 步:准备输入
- 一个主题(会写成 45–75 秒的文案)或一份完整文案;
- 一张清晰的成年人物图(仅限数字人路线,需确认你拥有使用权);
- 可选:声音样本(需明确授权克隆)、录屏或图片素材、交付偏好(平台、画幅、水印等)。
第 2 步:一句话下达需求
多数工具会根据 Skill 描述自动选中它,直接描述你想要的视频就行,例如:
把这份文案和人物图做成一条 30 秒、16:9、带实时字幕的数字人口播视频。
想做风格化讲解也不用先了解风格,直接问「有哪些风格」,agent 会带着效果图列出 9 种并为你推荐。
第 3 步:等 agent 自动走完流程
agent 会自己执行内置脚本,无需手动操作。如需手动建任务,可运行 scripts/init_job.py 创建自包含的任务目录:
SKILL_DIR=~/.claude/skills/lanshu-create-ai-presenter-video python3 "$SKILL_DIR/scripts/init_job.py" --job-dir ~/Videos/my-video \ --presenter-image ~/Pictures/presenter.png --topic "用一分钟讲清楚上下文工程" \ --rights-confirmed --adult-presenter-confirmed它替你做了什么:8 阶段证据驱动工作流 🔍
这是该项目最值得称道的设计:每个阶段都必须有磁盘上的真实产物作为证据,状态由 scripts/check_state.py 计算,而不是靠口头声明。
intake → content_locked → audio_locked → visual_plan_locked → presenter_generated → composition_checked → rendered → verified- 锁定配音是统一时钟:审定的完整配音决定人物动作、字幕、剪辑点和成片时长,口型与段落边界自然对齐;
- 先低成本试片:正式生成前先生成短试片,优先检查人物一致性和口型;
- 交付前双重验证:母版与分享版先完整解码、做响度检查(默认 −16 LUFS),全部通过才发布,并附九宫格截图和交付报告。
成本与安全护栏:放心用的底气 💰
- 首次付费调用前,agent 会明确列出上传内容、请求秒数、已知价格与重试上限;
- 连续 3 个付费候选被否决后自动停止,并总结问题;
- 图片使用权、人物成年确认、声音克隆授权,全部在上传前逐项确认;
- 风格化路线唯一的付费项是配音,逐句缓存,改一句只重配一句;
- 仓库不包含任何 API 密钥或用户素材,报告只记录文件名与相对路径。
常见问题 FAQ ❓
Q:没有真人照片能做吗?A:可以,走风格化讲解路线,完全不需要人物图,9 种风格任选,详见 explainer/STYLES.md。
Q:能换画幅或时长吗?A:可以,通过--aspect、--duration等参数指定;数字人路线默认 9:16 竖屏,风格化路线固定 16:9。
Q:想深入某一步怎么查文档?A:按阶段查阅即可:输入与生成看 references/generation.md,时间轴与字幕看 references/editing.md,故障修复看 references/qa-recovery.md,风格化路线看 references/styled-explainer.md。
延伸资源 📚
- SKILL.md:Skill 入口,完整工作流定义
- README.zh-CN.md:中文完整文档
- scripts/:任务初始化、预检、分段规划、交付验证脚本
- explainer/kits/:九种风格的风格包与起步模板
- explainer/examples/kv-cache/:九种风格的完整示例工程
- explainer/tools/:讲稿、建片、QA、渲染等讲解工具
安装好之后,打开 Claude Code 或 Codex,描述你想要的视频,剩下的交给 agent——你的第一条数字人口播视频,最快今天就能发布 🎉
【免费下载链接】lanshu-create-ai-presenter-videoProvider-neutral Codex Skill for producing verified AI presenter videos from a script and an authorized presenter image.项目地址: https://gitcode.com/gh_mirrors/la/lanshu-create-ai-presenter-video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考