☰
lanshu-create-ai-presenter-video快速上手教程:5分钟装进Claude Code或Codex,做出你的第一条数字人口播视频
2026/10/8 13:32:57 网站建设 项目流程

lanshu-create-ai-presenter-video快速上手教程:5分钟装进Claude Code或Codex,做出你的第一条数字人口播视频

【免费下载链接】lanshu-create-ai-presenter-videoProvider-neutral Codex Skill for producing verified AI presenter videos from a script and an authorized presenter image.项目地址: https://gitcode.com/gh_mirrors/la/lanshu-create-ai-presenter-video

lanshu-create-ai-presenter-video是一个开源的AI 数字人口播视频生成工具(Agent Skill):你只需给出一个主题或一段文案,再加一张已授权的真人照片,它就能带着 Claude Code、Codex 等 AI 编程助手,自动完成写稿、配音、数字人生成、口型同步、字幕、渲染与质量验收,最终交付一条可直接发布的讲解视频。本教程将带你在 5 分钟内完成安装,并做出第一条数字人口播视频。

先搞懂:它能做的两条路线 🎬

这个项目提供两种成片方式,agent 会根据你的描述自动判断该走哪条:

路线成片效果你需要提供付费生成画幅
数字人口播数字人出镜讲解,字幕和关键词动效辅助主题或文案 + 一张授权人物图配音 + 数字人视频任意,默认 9:16 竖屏
风格化讲解不用真人:每句话都用画面“演”出来,9 种视觉风格可选主题或文案(也可自带配音)只有配音16:9 横屏

风格化路线内置了 9 种视觉风格:设计师留白、科技感信号、手账手绘、纸艺立体书、波普漫画、3D 一镜到底、图纸与注脚、黑板报、黏土小城。下图是仓库自带的 KV cache 讲解片在九种风格中的同一时刻效果:

安装前环境清单 ✅

依赖说明
一个 coding agentClaude Code、Codex、Gemini CLI、Cursor 等支持 Agent Skills 的工具均可
Python 3.9+ / FFmpeg / Bash / jq本地基础环境
数字人路线至少一种可调用的配音、数字人视频生成与口型同步能力(云 CLI、API 或本地模型)
风格化路线Node.js、rsync、带numpy的 Python,以及 MiniMax API Key(或你自己录好的配音)

5分钟安装步骤:装进 Claude Code 或 Codex

整个安装就是一条 clone 命令——仓库目录本身就是 Skill,克隆到对应 skills 目录即可(目录名需保持为lanshu-create-ai-presenter-video):

# Claude Code git clone https://gitcode.com/gh_mirrors/la/lanshu-create-ai-presenter-video.git \ ~/.claude/skills/lanshu-create-ai-presenter-video
工具Skills 目录显式调用方式
Claude Code~/.claude/skills/(或项目内.claude/skills/)/lanshu-create-ai-presenter-video
Codex~/.codex/skills/$lanshu-create-ai-presenter-video
其他 Agent Skills 客户端见各自文档按客户端方式

安装完成后,在目录里执行git pull即可更新。如果多个工具共用,各克隆一份即可。

💡你的 agent 不支持 Agent Skills?把仓库克隆到任意位置,在对话开头说:「先阅读lanshu-create-ai-presenter-video/SKILL.md,并严格按其中的流程工作」,任何能读文件、跑命令的 agent 都能照做。

三步做出第一条数字人口播视频 🚀

第 1 步:准备输入

  • 一个主题(会写成 45–75 秒的文案)或一份完整文案;
  • 一张清晰的成年人物图(仅限数字人路线,需确认你拥有使用权);
  • 可选:声音样本(需明确授权克隆)、录屏或图片素材、交付偏好(平台、画幅、水印等)。

第 2 步:一句话下达需求

多数工具会根据 Skill 描述自动选中它,直接描述你想要的视频就行,例如:

把这份文案和人物图做成一条 30 秒、16:9、带实时字幕的数字人口播视频。

想做风格化讲解也不用先了解风格,直接问「有哪些风格」,agent 会带着效果图列出 9 种并为你推荐。

第 3 步:等 agent 自动走完流程

agent 会自己执行内置脚本,无需手动操作。如需手动建任务,可运行 scripts/init_job.py 创建自包含的任务目录:

SKILL_DIR=~/.claude/skills/lanshu-create-ai-presenter-video python3 "$SKILL_DIR/scripts/init_job.py" --job-dir ~/Videos/my-video \ --presenter-image ~/Pictures/presenter.png --topic "用一分钟讲清楚上下文工程" \ --rights-confirmed --adult-presenter-confirmed

它替你做了什么:8 阶段证据驱动工作流 🔍

这是该项目最值得称道的设计:每个阶段都必须有磁盘上的真实产物作为证据,状态由 scripts/check_state.py 计算,而不是靠口头声明。

intake → content_locked → audio_locked → visual_plan_locked → presenter_generated → composition_checked → rendered → verified
  • 锁定配音是统一时钟:审定的完整配音决定人物动作、字幕、剪辑点和成片时长,口型与段落边界自然对齐;
  • 先低成本试片:正式生成前先生成短试片,优先检查人物一致性和口型;
  • 交付前双重验证:母版与分享版先完整解码、做响度检查(默认 −16 LUFS),全部通过才发布,并附九宫格截图和交付报告。

成本与安全护栏:放心用的底气 💰

  • 首次付费调用前,agent 会明确列出上传内容、请求秒数、已知价格与重试上限;
  • 连续 3 个付费候选被否决后自动停止,并总结问题;
  • 图片使用权、人物成年确认、声音克隆授权,全部在上传前逐项确认;
  • 风格化路线唯一的付费项是配音,逐句缓存,改一句只重配一句;
  • 仓库不包含任何 API 密钥或用户素材,报告只记录文件名与相对路径。

常见问题 FAQ ❓

Q:没有真人照片能做吗?A:可以,走风格化讲解路线,完全不需要人物图,9 种风格任选,详见 explainer/STYLES.md。

Q:能换画幅或时长吗?A:可以,通过--aspect、--duration等参数指定;数字人路线默认 9:16 竖屏,风格化路线固定 16:9。

Q:想深入某一步怎么查文档?A:按阶段查阅即可:输入与生成看 references/generation.md,时间轴与字幕看 references/editing.md,故障修复看 references/qa-recovery.md,风格化路线看 references/styled-explainer.md。

延伸资源 📚

  • SKILL.md:Skill 入口,完整工作流定义
  • README.zh-CN.md:中文完整文档
  • scripts/:任务初始化、预检、分段规划、交付验证脚本
  • explainer/kits/:九种风格的风格包与起步模板
  • explainer/examples/kv-cache/:九种风格的完整示例工程
  • explainer/tools/:讲稿、建片、QA、渲染等讲解工具

安装好之后,打开 Claude Code 或 Codex,描述你想要的视频,剩下的交给 agent——你的第一条数字人口播视频,最快今天就能发布 🎉

【免费下载链接】lanshu-create-ai-presenter-videoProvider-neutral Codex Skill for producing verified AI presenter videos from a script and an authorized presenter image.项目地址: https://gitcode.com/gh_mirrors/la/lanshu-create-ai-presenter-video

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询