AI视频制作全流程实战:从分镜脚本、人物设计到剪辑配音,一篇文章跑通AI动画短片
先说一个容易被短视频平台“标题党”带偏的结论:AI视频制作,不是输入一句话就自动出片的魔法,而是一条可以被拆解、被标准化、被复用的内容生产线。
真正做过AI动画的人都会遇到同一个尴尬:模型生成的单张图质量很高,但人物在下一个镜头里就不是同一个人了;镜头单独看很惊艳,但拼在一起没有叙事节奏;配音倒是快,但和画面情绪完全对不上。这些问题靠换一个“更强的视频生成模型”是解决不了的,因为它们的源头都在流程设计上。
这篇文章不聊虚的。我会从分镜脚本、人物设计、镜头语言、剪辑配音四个环节,把AI动画短片的生产全流程拆开来讲,并给出可以直接复制的Prompt模板、配置文件和工作流命令。无论你是想做信息流广告、AI漫剧、短剧预告片,还是接外包单子,这套流程都能让你从“生成素材”升级为“生产内容”。
1. AI视频制作:不是一键出片,而是一条内容生产线
很多人第一次接触AI视频,都是被“一句话生成一只赛博狐狸在雪地里奔跑”这种视频冲击到的。但请注意,这类视频能成功,是因为它只需要一个镜头、一个主体、一个氛围,根本不需要考虑叙事连续性。
一旦要做真正的短片,哪怕只有30秒,问题立刻变多:
- 主角从第1镜头到第8镜头,脸型、服装、配色必须保持一致;
- 分镜之间的景别切换要符合观看逻辑,不能一会儿特写一会儿远景乱跳;
- 画面中出现的光线方向、天气状态、时间线要统一;
- 配音、字幕、转场、BGM要和画面的节奏匹配。
所以,我更愿意把AI视频制作定义为“内容工程”,而不是“视频生成”。它的核心能力不是点几个按钮,而是:
- 把故事转成结构化的分镜脚本;
- 用可控的方式生成一致性人物素材;
- 按镜头语言设计运镜和转场;
- 把素材批量处理成成片。
这套流程对新手最友好的地方在于:你不需要等到视频生成模型足够强才能开工。只要把前两步做扎实,哪怕用很普通的图生视频工具,也能产出比“单独抽卡”稳定得多的作品。
2. 核心概念:分镜脚本、人物一致性、镜头语言到底指什么
在进入实操之前,先把几个高频关键词讲清楚。这些词的理解深度,直接决定你后面会不会返工。
2.1 分镜脚本
分镜脚本,就是把“文字故事”翻译成“画面清单”。它需要写明:每个镜头是几秒、什么景别、什么机位、画面里有什么、角色做什么动作、有没有台词或旁白。
为什么要先在脚本阶段下功夫?因为AI视频制作成本集中在“生成环节”。如果脚本含糊,你根本不知道要让模型生成什么,只能一遍遍试,成本完全失控。脚本足够具体,生成时才能做到“一次接近可用”。
下面是一个基础分镜字段设计:
| 字段 | 作用 | 示例 |
|---|---|---|
| 镜号 | 唯一编号 | SC-001 |
| 时长 | 秒数 | 4s |
| 景别 | 远景/全景/中景/近景/特写 | 全景 |
| 机位 | 仰拍/俯拍/平视/过肩 | 平视 |
| 画面内容 | 主体动作+环境 | 男主撑伞站在雨夜路灯下 |
| 台词/旁白 | 对应音频内容 | “那一晚,他决定离开这座城市” |
| 情绪 | 氛围关键词 | 压抑、孤独 |
2.2 人物一致性
人物一致性,指的是同一个角色在多个镜头里看起来是同一个人。这是AI动画最核心的难点,也是接单时客户最看重的点。
目前业界用的不是某一种“万能功能”,而是组合策略:
- 固定种子:尽可能用同一个随机种子生成;
- 垫图/参考图:用首张满意的角色图作为后续生成的参考;
- 角色描述符:一段非常详细且固定的人物外观文本,始终拼在Prompt里;
- 图生视频:先有图,再让画面动起来,而不是每次文生视频。
这个策略不一定能让两个镜头完全一致,但能把偏差控制在一个可接受的范围内。对商业项目来说,“可接受”比“完美”重要得多。
2.3 镜头语言
镜头语言是指用景别、机位、运动方式、光线来传递情绪和叙事信息。AI视频生成工具往往提供“镜头运动”参数,但我们自己要先知道哪个镜头该做什么选择:
- 远景/大远景:交代环境、人物所处位置;
- 全景:看清角色全身动作;
- 中景:兼顾动作和表情,适合对话;
- 近景/特写:强调情绪、细节;
- 推镜头:引导观众注意力;
- 拉镜头:从细节扩展到环境;
- 摇镜头:展示空间关系。
很多新人走到“画面生成”这一步才开始想景别,这是本末倒置。景别应该在分镜脚本阶段就决定好,因为不同景别对人物细节的暴露程度不同,直接决定一致性控制的难度。
3. AI视频工具矩阵:不同环节选什么工具
AI视频生产线的每个环节都有相对好用的工具类型。这里不写具体版本号,因为工具更新实在太快,给一个选型思路更可靠。
3.1 文本生成与脚本工具
用来写故事、拉分镜、生成Prompt。可以选择ChatGPT、DeepSeek、Kimi等通用大模型。这一阶段的重点不是“文采”,而是把一句故事扩写成结构化、可执行的分镜JSON。
3.2 图像生成与人物设计
主流方向是Stable Diffusion、Midjourney、即梦、可灵等。绘图工具负责产出“人物三视图”“关键帧插画”“场景背景图”。
从工程角度看,Stable Diffusion生态更受团队欢迎,因为它有Lora、ControlNet、固定Seed、批量脚本这些可控性功能;Midjourney则在单图质量和美观度上更省心,但一致性控制偏弱。短期项目、强风格化作品可以多用Midjourney,连载型AI漫剧则更推荐Stable Diffusion生态。
3.3 视频生成工具
视频生成这一步,常见选择包括可灵、即梦、Runway、Pika、Sora等。很多视频生成工具同时支持图生视频和文生视频。做剧情短片时,图生视频是优先选择,因为它能继承你精心设计的人物图。
3.4 配音、音乐与剪辑工具
配音可以用Edge TTS、剪映、魔音工坊等;音乐可以在剪映曲库、网易天音等平台找;剪辑统一用剪映或Premiere Pro。AI动画的剪辑量不大,剪映足够。
| 生产环节 | 工具类型 | 选型要点 |
|---|---|---|
| 分镜脚本 | 通用大模型 | 支持结构化导出Prompt |
| 人物设计 | SD生态 / Midjourney | 可控性优先 vs 美观度优先 |
| 视频生成 | 可灵 / 即梦 / Runway / Pika | 图生视频能力优先 |
| 配音 | Edge TTS / 剪映配音 | 支持多情绪、语速可调 |
| 剪辑 | 剪映 / PR | 模板丰富、字幕方便 |
4. 第一步:用结构化提示词生成分镜脚本
很多人的第一句Prompt是:“帮我写一个关于失恋的短剧。”然后得到一段漂亮但没有执行性的故事文案。问题出在:你让模型写的是“故事”,而不是“制作方案”。
正确做法是,让模型直接输出可解析的分镜JSON,并在里面固定场景、人物、镜头、台词、时长。这样一个Step,能把后续所有环节的输入词都统一起来。
下面这个JSON模板,可以直接复制给大模型让它按格式输出:
{ "project": "雨夜告别", "story": "男主角在雨夜路灯下告别旧城,五年后回到原地发现一切都已改变。", "character": [ { "id": "male_01", "name": "阿远", "appearance": "28岁,黑色短发,深灰色长风衣,内搭白色衬衫,五官轮廓清晰,眼神疲惫但坚定", "style": "写实都市漫画风格,电影感光影" } ], "shots": [ { "shot_id": "SC-001", "duration": 4, "scene": "雨夜老城街道,昏黄路灯,地面有积水倒影", "shot_size": "全景", "camera_movement": "缓慢推近", "action": "阿远打着一把黑伞,站在路灯下抬头看旧楼", "dialogue": "旁白:五年了,我还记得这个路口。", "emotion": "压抑、怀念" }, { "shot_id": "SC-002", "duration": 3, "scene": "同上", "shot_size": "近景", "camera_movement": "固定镜头", "action": "阿远低头,雨滴打在伞面上,表情露出一丝苦笑", "dialogue": "", "emotion": "孤独、释然" } ] }生成这个JSON后,建议让模型再输出一份人类可读的分镜表,方便放在剪辑软件旁边对照使用。可以有这样一个Prompt:
你是AI动画短片的导演兼分镜师。请根据下面要求输出分镜: 1. 故事主题:都市奇幻,主角能在旧照片中穿行; 2. 总时长:30秒; 3. 输出格式:先输出每个镜头的表格,再输出符合以下字段的JSON:shot_id、duration、scene、shot_size、camera_movement、action、dialogue、emotion。 4. 要求:每个镜头之间景别有变化,避免连续三个镜头都是同一种景别。值得注意的是,分镜脚本生成后,不要马上进入绘图。建议先做一次“脑内放映”:把每个镜头按顺序读一遍,想象画面是否连贯。如果自己脑海里都断片,模型一定生成不好。
5. 第二步:人物设计与一致性控制
人物做不好,后面所有镜头都会翻车。这个环节有两个核心任务:先定外观,再保一致。
5.1 人物外观固定
首先要把“角色外观”从分镜故事里单独抽出来,写成一个固定描述串。这段文字在每次生成图像时都要用,尽量一字不改。我建议的字段顺序是:
年龄+性别,体型特征,发型发色,脸型,眼睛颜色,五官特点,服装(上身、下身、外套、配饰),材质细节,整体绘画风格,光影风格示例:
28岁亚洲男性,偏瘦,黑色微卷短发,脸型偏窄,深棕色眼睛,五官轮廓清晰,下巴有轻微胡茬,身穿深灰色长风衣,内搭白色衬衫,黑色长裤,黑色皮靴,服装材质有明显布料质感,写实都市漫画风格,电影感光影,浅蓝灰冷色调这段文字建议配一个“角色卡”字典,方便后续程序自动拼接。
5.2 通过代码批量构造Prompt
如果镜头数量多,手写每条Prompt容易漏字,你可以用一个小脚本把“固定角色描述 + 场景 + 镜头运动”拼起来。下面是一段Python示例代码,假设你拿到了第4节的分镜JSON:
# 文件路径:build_prompts.py import json # 角色固定描述,生成所有镜头时保持不变 CHARACTER = ( "28岁亚洲男性,偏瘦,黑色微卷短发,脸型偏窄,深棕色眼睛," "身穿深灰色长风衣,内搭白色衬衫,黑色长裤,黑色皮靴," "写实都市漫画风格,电影感光影,浅蓝灰冷色调" ) def build_prompt_for_shot(shot: dict, character: str) -> str: prompt = ( f"角色:{character}。" f"场景:{shot['scene']}。" f"景别:{shot['shot_size']}。" f"动作:{shot['action']}。" f"镜头运动:{shot['camera_movement']}。" f"情绪氛围:{shot['emotion']}。" "高质量,细节丰富,画面干净,无文字水印" ) return prompt if __name__ == "__main__": with open("fenjing.json", "r", encoding="utf-8") as f: data = json.load(f) for shot in data["shots"]: print(shot["shot_id"], build_prompt_for_shot(shot, CHARACTER))这段代码看起来简单,但它保证了“角色描述不漂移”。实际项目中,很多人翻车就是因为每个镜头都临时改了一句服装描述,导致角色气质完全失控。
5.3 用参考图和图生视频锁一致性
如果你使用支持参考图功能的工具,操作路径通常是:
- 先生成一张你最满意的角色站姿图;
- 用图生图/局部重绘调整表情和动作;
- 把最终定稿图作为每一段视频生成的起始帧;
- 视频生成时选择“图生视频”,并控制运动幅度不要太剧烈。
这套组合的核心逻辑是:让AI在“已有图上补动作”,而不是“凭文字重画一张图”。
5.4 一个需要提前避开的坑
在人物外观中加入过多当前工具不理解的抽象词,只会降低命中率。比如“高智商脸”“破碎感”“忧郁氛围”这类词,不同模型理解完全不同。宁可把这些情绪放进场景、光线和动作里,也不要放进人物形象描述里。
6. 第三步:镜头语言设计与AI运镜控制
绘图和视频生成工具都支持在Prompt中描述镜头,但描述方式有讲究。用自然语言描述“镜头慢慢推近”是有效的,但如果需要更强控制,建议同时给出“景别 + 机位 + 运动 + 结束画面”四要素。
6.1 常用镜头提示词模板
[景别],[机位],[镜头运动],画面主体[动作描述],背景[环境描述],光线[光线描述],情绪[情绪描述]示例:
近景,平视镜头,缓慢向前推近,画面主体为黑衣男子站在雨夜路灯下低头苦笑,身后老城街道虚化,暖黄路灯与冷蓝夜色对比,情绪孤独但释然6.2 连续镜头要避免“镜头跳跃感”
30秒短片里,镜头之间的景别节奏要设计过,不能随机抽。推荐一个基础节奏公式:
全景定环境 -> 中景进入人物 -> 近景给情绪 -> 特写给细节 -> 全景收束如果连续三个镜头都是近景,观众会缺少“空间定位”。如果全是全景,又看不到情绪。真正有镜头感的片子,就是在这几个景别之间来回切换,而且切换原因都是“为了让观众注意什么”。
6.3 运动幅度不是越大越好
AI视频生成工具对大幅运动的处理能力有限。人物跑步、快速转身、镜头急推,都容易出现形变和闪烁。从工程角度看,建议:
- 人物动作幅度控制在小到中等范围;
- 优先使用“缓慢推近”“缓慢上摇”“固定镜头加人物移动”这类稳定性高的运镜;
- 真正需要剧烈运动时,把动作拆成多段,中间用转场过渡。
在分镜阶段就设定好“每个镜头只有一到两个核心动作”,能显著提升成片率。
7. 第四步:批量生成镜头素材、剪辑与配音
当分镜脚本和人物设计都定了,就可以进入批量生产阶段。这个阶段最值得投入时间的不是素材生成本身,而是建立一套统一的文件命名和素材管理规范。
7.1 素材文件命名规范
推荐命名格式:
{项目名}_{镜号}_{版本号}.mp4示例:
yuwang_gaobian_SC-001_v1.mp4 yuwang_gaobian_SC-001_v2.mp4为什么要带版本号?因为AI生成经常需要抽卡。不带版本号时,改两版之后你就分不清哪个是最终版,剪辑时极其痛苦。
7.2 用Edge TTS快速生成配音脚本
配音是AI动画很容易“出戏”的环节。如果工具自带的音色不够有感情,可以先用Edge TTS批量生成小样,再进剪映精调。Edge TTS支持多个中文音色和语速调节,适合快速试听。
# 安装Edge TTS pip install edge-tts # 生成配音,指定音色、语速、输出文件 edge-tts --voice zh-CN-YunxiNeural --rate=-10% --text "五年了,我还记得这个路口。" --write-media sc001.mp3这里选用zh-CN-YunxiNeural只是示例,也可以用其他音色。生成后关键一步是:把配音文件按镜号对应好,再剪掉多余空白。
7.3 用FFmpeg合并视频和音频
如果镜头已经导出为独立mp4片段,可以用FFmpeg做一次拼接。下面是一个基础示例,把SC-001到SC-003加上配音文件合成一段预览:
# 文件列表filelist.txt里按顺序写入 # file 'yuwang_gaobian_SC-001_v1.mp4' # file 'yuwang_gaobian_SC-002_v1.mp4' # file 'yuwang_gaobian_SC-003_v1.mp4' ffmpeg -f concat -safe 0 -i filelist.txt -i voice.mp3 -c:v libx264 -c:a aac -shortest preview_30s.mp4如果镜头时长和配音时长不匹配,建议先按旁白节奏剪辑,再调整画面速度。不要上来就把每个镜头锁死成4秒,旁白长一点就露怯。
7.4 剪辑时机的把控
从流程上说,AI视频制作最合理的顺序是:
- 先配好旁白/配音;
- 按配音节奏切分镜时长;
- 再根据分镜时长去生成或剪辑画面;
- 最后加字幕、BGM和转场。
很多新手喜欢先生成一堆视频素材,再开剪辑软件硬拼。这样很容易出现“画面好看但节奏稀碎”的结果。
8. 实战案例:30秒都市奇幻AI短片全流程拆解
用一个30秒短片来串联前面的所有步骤。这是一个非常典型的信息流广告或者AI漫剧预告片场景。
8.1 故事设定
主题:主角阿远发现自己可以穿进旧照片,改变过去的一点小事,却导致现实发生巨变。
8.2 分镜脚本
| 镜号 | 时长 | 景别 | 画面内容 | 台词/旁白 |
|---|---|---|---|---|
| SC-001 | 3s | 全景 | 雨夜旧城街道,阿远站在路灯下 | 旁白:每张旧照片,都是一扇门。 |
| SC-002 | 3s | 近景 | 阿远眼神从迷茫变为坚定 | 旁白:我曾以为,改一个细节不会怎样。 |
| SC-003 | 5s | 中景 | 阿远手触摸墙面上的黑白老照片 | 旁白:但我忘了,过去是会反噬的。 |
| SC-004 | 5s | 特写 | 照片中的人像眼睛动了一下 | 无旁白,音效:心跳声 |
| SC-005 | 4s | 大全景 | 城市在黄昏中扭曲,像胶片融化 | 旁白:你准备好,付出代价了吗? |
这份脚本只有5个镜头,但把背景、人物、冲突、悬念都交代清楚了。实际执行时可以从这个体量开始,先跑通,再扩成60秒。
8.3 关键执行顺序
- 先用第4节的JSON模板把分镜输出为结构化数据;
- 用第5节的方法生成主角阿远的固定角色描述,并生成角色定妆图;
- 每个镜头用“固定角色 + 场景 + 景别 + 动作 + 运镜”构造Prompt;
- 优先用参考图和图生视频生成镜头素材;
- 用Edge TTS按旁白生成音频;
- 在剪映里按旁白节奏排列镜头,加字幕、BGM和转场;
- 导出预览,检查人物一致性和镜头连贯性,不合格的镜头单独重抽。
9. AI视频制作常见问题与排查思路
新手最容易在下面几个问题上卡住。记住一个原则:先判断问题发生在“生成环节”还是“剪辑环节”,再动手重做,不要从头推倒。
| 问题现象 | 可能原因 | 排查方式 | 解决方案 |
|---|---|---|---|
| 人物在下一个镜头里变样 | 角色描述不统一,工具没吃透参考图 | 检查每个镜头Prompt里的角色描述是否完全一致 | 固定角色描述串;用角色参考图;降低模型想象力参数 |
| 视频生成后人物面部扭曲 | 运动幅度过大,画面中主体太小 | 换近景/特写镜头再生成 | 减小运镜幅度,增加主体在画面中的占比 |
| 镜头之间光线不一致 | 每张图用了不同的时间/天气描述 | 在分镜脚本中统一定义光线关键词 | 约定“暖黄路灯+冷蓝夜色+雨夜”全局风格 |
| 旁白与画面节奏对不上 | 先剪了画面再配旁白 | 回顾剪辑顺序 | 改为先排旁白,再按旁白切镜头 |
| 生成结果总是带字幕水印 | 反向提示词中没有屏蔽文字 | 检查工具质量提示和负面提示词 | 加入“无文字、无字幕、无水印、干净画面” |
| 单个镜头好看但整体像PPT | 镜头之间没有动作衔接 | 检查分镜是否有固定连续动作 | 增加肢体动作、镜头运动,或加转场特效 |
如果镜头生成出来人物变了,建议优先重抽当前镜头,而不是全局调整。每次只改一个变量:要么改Prompt里的一处描述,要么换参考图,要么改运动幅度,直到找到稳定因素。
10. AI视频制作的最佳实践与变现建议
最后这部分,写给那些准备把AI动画当成作品集、兼职接单甚至团队项目的读者。
10.1 内容制作层面的最佳实践
第一,建立可复用的项目模板。把分镜JSON、角色描述符、Prompt拼接脚本、文件命名规范沉淀成一个固定模板,每次接新项目只替换项目名和故事内容。这样能大幅降低重复工作。
第二,素材库要分类管理。我建议按“角色”“场景”“表情”“动作”“道具素材”文件夹分类,方便后续复用。比如上个月设计的“雨夜街道”,这个月可能改个天气描述就能再用一次。
第三,成片率意识。AI视频不是一次成功,而是“批量生成-筛选-修复”的过程。给每个镜头批量生成多个候选再挑,比反复手动调参生成同一镜头更高效。
第四,版本回溯。每个阶段保存一个版本,脚本改到第3版时你突然觉得第1版更好,这种情况很常见。保留版本文件,比事后后悔更实际。
10.2 变现路径建议
AI视频制作的变现,并不只有“做号涨粉”这一条路。从实际市场看,比较常见的方向有:
| 变现方向 | 适合谁 | 关键要求 |
|---|---|---|
| 信息流广告素材 | 能快速出片的人 | 30秒以内,视觉冲击强 |
| AI漫剧/短剧分账 | 有叙事能力的人 | 人物一致性要求高,集数多 |
| 外包接单 | 全流程都能控制的人 | 交付规范,修版本意识强 |
| 教程/知识付费 | 流程经验丰富的人 | 有可复制的SOP和案例 |
| 自有IP内容变现 | 有选题能力的人 | 稳定更新,内容差异化 |
无论选哪条路,最核心的能力都是“稳定交付”。客户不会因为你某条视频爆了就买单,但会因为“这次的脸和上次一模一样,不会崩”而信任你。
10.3 现阶段的学习顺序建议
如果你是从零开始,不建议一上来就学十种工具。按下面顺序推进:
- 先用通用大模型生成一个包含5个镜头的分镜脚本;
- 用任意一款绘图工具生成一张角色定妆图;
- 用图生视频工具把这张图变成一个5秒镜头;
- 用Edge TTS生成旁白,在剪映里拼成15秒短视频;
- 把流程跑通之后,再回头研究人物一致性和镜头语言优化。
不要把时间浪费在“囤积Prompt”上。同一个Prompt在不同模型、不同参考图、不同参数下的表现差异巨大。真正重要的是你能不能让角色连续出现在三个镜头里,并且让观众看完之后愿意把进度条拖回去再刷一遍。
AI视频工具会在未来一年内继续升级,但“内容工程化”这套思维方式不会过时。脚本先行、人物可控、镜头有依据、剪辑有节奏,这才是AI动画从“能出片”走向“能接单”的临界点。建议收藏这篇文章,下一部想做的短片,就照着这套流程跑一遍。