AI视频制作全流程:从分镜脚本到剪辑配音的标准化工作流
2026/9/7 6:31:25 网站建设 项目流程

AI视频制作全流程实战:从分镜脚本、人物设计到剪辑配音,一篇文章跑通AI动画短片

先说一个容易被短视频平台“标题党”带偏的结论:AI视频制作,不是输入一句话就自动出片的魔法,而是一条可以被拆解、被标准化、被复用的内容生产线。

真正做过AI动画的人都会遇到同一个尴尬:模型生成的单张图质量很高,但人物在下一个镜头里就不是同一个人了;镜头单独看很惊艳,但拼在一起没有叙事节奏;配音倒是快,但和画面情绪完全对不上。这些问题靠换一个“更强的视频生成模型”是解决不了的,因为它们的源头都在流程设计上。

这篇文章不聊虚的。我会从分镜脚本、人物设计、镜头语言、剪辑配音四个环节,把AI动画短片的生产全流程拆开来讲,并给出可以直接复制的Prompt模板、配置文件和工作流命令。无论你是想做信息流广告、AI漫剧、短剧预告片,还是接外包单子,这套流程都能让你从“生成素材”升级为“生产内容”。

1. AI视频制作:不是一键出片,而是一条内容生产线

很多人第一次接触AI视频,都是被“一句话生成一只赛博狐狸在雪地里奔跑”这种视频冲击到的。但请注意,这类视频能成功,是因为它只需要一个镜头、一个主体、一个氛围,根本不需要考虑叙事连续性。

一旦要做真正的短片,哪怕只有30秒,问题立刻变多:

  • 主角从第1镜头到第8镜头,脸型、服装、配色必须保持一致;
  • 分镜之间的景别切换要符合观看逻辑,不能一会儿特写一会儿远景乱跳;
  • 画面中出现的光线方向、天气状态、时间线要统一;
  • 配音、字幕、转场、BGM要和画面的节奏匹配。

所以,我更愿意把AI视频制作定义为“内容工程”,而不是“视频生成”。它的核心能力不是点几个按钮,而是:

  1. 把故事转成结构化的分镜脚本;
  2. 用可控的方式生成一致性人物素材;
  3. 按镜头语言设计运镜和转场;
  4. 把素材批量处理成成片。

这套流程对新手最友好的地方在于:你不需要等到视频生成模型足够强才能开工。只要把前两步做扎实,哪怕用很普通的图生视频工具,也能产出比“单独抽卡”稳定得多的作品。

2. 核心概念:分镜脚本、人物一致性、镜头语言到底指什么

在进入实操之前,先把几个高频关键词讲清楚。这些词的理解深度,直接决定你后面会不会返工。

2.1 分镜脚本

分镜脚本,就是把“文字故事”翻译成“画面清单”。它需要写明:每个镜头是几秒、什么景别、什么机位、画面里有什么、角色做什么动作、有没有台词或旁白。

为什么要先在脚本阶段下功夫?因为AI视频制作成本集中在“生成环节”。如果脚本含糊,你根本不知道要让模型生成什么,只能一遍遍试,成本完全失控。脚本足够具体,生成时才能做到“一次接近可用”。

下面是一个基础分镜字段设计:

字段作用示例
镜号唯一编号SC-001
时长秒数4s
景别远景/全景/中景/近景/特写全景
机位仰拍/俯拍/平视/过肩平视
画面内容主体动作+环境男主撑伞站在雨夜路灯下
台词/旁白对应音频内容“那一晚,他决定离开这座城市”
情绪氛围关键词压抑、孤独

2.2 人物一致性

人物一致性,指的是同一个角色在多个镜头里看起来是同一个人。这是AI动画最核心的难点,也是接单时客户最看重的点。

目前业界用的不是某一种“万能功能”,而是组合策略:

  • 固定种子:尽可能用同一个随机种子生成;
  • 垫图/参考图:用首张满意的角色图作为后续生成的参考;
  • 角色描述符:一段非常详细且固定的人物外观文本,始终拼在Prompt里;
  • 图生视频:先有图,再让画面动起来,而不是每次文生视频。

这个策略不一定能让两个镜头完全一致,但能把偏差控制在一个可接受的范围内。对商业项目来说,“可接受”比“完美”重要得多。

2.3 镜头语言

镜头语言是指用景别、机位、运动方式、光线来传递情绪和叙事信息。AI视频生成工具往往提供“镜头运动”参数,但我们自己要先知道哪个镜头该做什么选择:

  • 远景/大远景:交代环境、人物所处位置;
  • 全景:看清角色全身动作;
  • 中景:兼顾动作和表情,适合对话;
  • 近景/特写:强调情绪、细节;
  • 推镜头:引导观众注意力;
  • 拉镜头:从细节扩展到环境;
  • 摇镜头:展示空间关系。

很多新人走到“画面生成”这一步才开始想景别,这是本末倒置。景别应该在分镜脚本阶段就决定好,因为不同景别对人物细节的暴露程度不同,直接决定一致性控制的难度。

3. AI视频工具矩阵:不同环节选什么工具

AI视频生产线的每个环节都有相对好用的工具类型。这里不写具体版本号,因为工具更新实在太快,给一个选型思路更可靠。

3.1 文本生成与脚本工具

用来写故事、拉分镜、生成Prompt。可以选择ChatGPT、DeepSeek、Kimi等通用大模型。这一阶段的重点不是“文采”,而是把一句故事扩写成结构化、可执行的分镜JSON。

3.2 图像生成与人物设计

主流方向是Stable Diffusion、Midjourney、即梦、可灵等。绘图工具负责产出“人物三视图”“关键帧插画”“场景背景图”。

从工程角度看,Stable Diffusion生态更受团队欢迎,因为它有Lora、ControlNet、固定Seed、批量脚本这些可控性功能;Midjourney则在单图质量和美观度上更省心,但一致性控制偏弱。短期项目、强风格化作品可以多用Midjourney,连载型AI漫剧则更推荐Stable Diffusion生态。

3.3 视频生成工具

视频生成这一步,常见选择包括可灵、即梦、Runway、Pika、Sora等。很多视频生成工具同时支持图生视频和文生视频。做剧情短片时,图生视频是优先选择,因为它能继承你精心设计的人物图。

3.4 配音、音乐与剪辑工具

配音可以用Edge TTS、剪映、魔音工坊等;音乐可以在剪映曲库、网易天音等平台找;剪辑统一用剪映或Premiere Pro。AI动画的剪辑量不大,剪映足够。

生产环节工具类型选型要点
分镜脚本通用大模型支持结构化导出Prompt
人物设计SD生态 / Midjourney可控性优先 vs 美观度优先
视频生成可灵 / 即梦 / Runway / Pika图生视频能力优先
配音Edge TTS / 剪映配音支持多情绪、语速可调
剪辑剪映 / PR模板丰富、字幕方便

4. 第一步:用结构化提示词生成分镜脚本

很多人的第一句Prompt是:“帮我写一个关于失恋的短剧。”然后得到一段漂亮但没有执行性的故事文案。问题出在:你让模型写的是“故事”,而不是“制作方案”。

正确做法是,让模型直接输出可解析的分镜JSON,并在里面固定场景、人物、镜头、台词、时长。这样一个Step,能把后续所有环节的输入词都统一起来。

下面这个JSON模板,可以直接复制给大模型让它按格式输出:

{ "project": "雨夜告别", "story": "男主角在雨夜路灯下告别旧城,五年后回到原地发现一切都已改变。", "character": [ { "id": "male_01", "name": "阿远", "appearance": "28岁,黑色短发,深灰色长风衣,内搭白色衬衫,五官轮廓清晰,眼神疲惫但坚定", "style": "写实都市漫画风格,电影感光影" } ], "shots": [ { "shot_id": "SC-001", "duration": 4, "scene": "雨夜老城街道,昏黄路灯,地面有积水倒影", "shot_size": "全景", "camera_movement": "缓慢推近", "action": "阿远打着一把黑伞,站在路灯下抬头看旧楼", "dialogue": "旁白:五年了,我还记得这个路口。", "emotion": "压抑、怀念" }, { "shot_id": "SC-002", "duration": 3, "scene": "同上", "shot_size": "近景", "camera_movement": "固定镜头", "action": "阿远低头,雨滴打在伞面上,表情露出一丝苦笑", "dialogue": "", "emotion": "孤独、释然" } ] }

生成这个JSON后,建议让模型再输出一份人类可读的分镜表,方便放在剪辑软件旁边对照使用。可以有这样一个Prompt:

你是AI动画短片的导演兼分镜师。请根据下面要求输出分镜: 1. 故事主题:都市奇幻,主角能在旧照片中穿行; 2. 总时长:30秒; 3. 输出格式:先输出每个镜头的表格,再输出符合以下字段的JSON:shot_id、duration、scene、shot_size、camera_movement、action、dialogue、emotion。 4. 要求:每个镜头之间景别有变化,避免连续三个镜头都是同一种景别。

值得注意的是,分镜脚本生成后,不要马上进入绘图。建议先做一次“脑内放映”:把每个镜头按顺序读一遍,想象画面是否连贯。如果自己脑海里都断片,模型一定生成不好。

5. 第二步:人物设计与一致性控制

人物做不好,后面所有镜头都会翻车。这个环节有两个核心任务:先定外观,再保一致。

5.1 人物外观固定

首先要把“角色外观”从分镜故事里单独抽出来,写成一个固定描述串。这段文字在每次生成图像时都要用,尽量一字不改。我建议的字段顺序是:

年龄+性别,体型特征,发型发色,脸型,眼睛颜色,五官特点,服装(上身、下身、外套、配饰),材质细节,整体绘画风格,光影风格

示例:

28岁亚洲男性,偏瘦,黑色微卷短发,脸型偏窄,深棕色眼睛,五官轮廓清晰,下巴有轻微胡茬,身穿深灰色长风衣,内搭白色衬衫,黑色长裤,黑色皮靴,服装材质有明显布料质感,写实都市漫画风格,电影感光影,浅蓝灰冷色调

这段文字建议配一个“角色卡”字典,方便后续程序自动拼接。

5.2 通过代码批量构造Prompt

如果镜头数量多,手写每条Prompt容易漏字,你可以用一个小脚本把“固定角色描述 + 场景 + 镜头运动”拼起来。下面是一段Python示例代码,假设你拿到了第4节的分镜JSON:

# 文件路径:build_prompts.py import json # 角色固定描述,生成所有镜头时保持不变 CHARACTER = ( "28岁亚洲男性,偏瘦,黑色微卷短发,脸型偏窄,深棕色眼睛," "身穿深灰色长风衣,内搭白色衬衫,黑色长裤,黑色皮靴," "写实都市漫画风格,电影感光影,浅蓝灰冷色调" ) def build_prompt_for_shot(shot: dict, character: str) -> str: prompt = ( f"角色:{character}。" f"场景:{shot['scene']}。" f"景别:{shot['shot_size']}。" f"动作:{shot['action']}。" f"镜头运动:{shot['camera_movement']}。" f"情绪氛围:{shot['emotion']}。" "高质量,细节丰富,画面干净,无文字水印" ) return prompt if __name__ == "__main__": with open("fenjing.json", "r", encoding="utf-8") as f: data = json.load(f) for shot in data["shots"]: print(shot["shot_id"], build_prompt_for_shot(shot, CHARACTER))

这段代码看起来简单,但它保证了“角色描述不漂移”。实际项目中,很多人翻车就是因为每个镜头都临时改了一句服装描述,导致角色气质完全失控。

5.3 用参考图和图生视频锁一致性

如果你使用支持参考图功能的工具,操作路径通常是:

  1. 先生成一张你最满意的角色站姿图;
  2. 用图生图/局部重绘调整表情和动作;
  3. 把最终定稿图作为每一段视频生成的起始帧;
  4. 视频生成时选择“图生视频”,并控制运动幅度不要太剧烈。

这套组合的核心逻辑是:让AI在“已有图上补动作”,而不是“凭文字重画一张图”。

5.4 一个需要提前避开的坑

在人物外观中加入过多当前工具不理解的抽象词,只会降低命中率。比如“高智商脸”“破碎感”“忧郁氛围”这类词,不同模型理解完全不同。宁可把这些情绪放进场景、光线和动作里,也不要放进人物形象描述里。

6. 第三步:镜头语言设计与AI运镜控制

绘图和视频生成工具都支持在Prompt中描述镜头,但描述方式有讲究。用自然语言描述“镜头慢慢推近”是有效的,但如果需要更强控制,建议同时给出“景别 + 机位 + 运动 + 结束画面”四要素。

6.1 常用镜头提示词模板

[景别],[机位],[镜头运动],画面主体[动作描述],背景[环境描述],光线[光线描述],情绪[情绪描述]

示例:

近景,平视镜头,缓慢向前推近,画面主体为黑衣男子站在雨夜路灯下低头苦笑,身后老城街道虚化,暖黄路灯与冷蓝夜色对比,情绪孤独但释然

6.2 连续镜头要避免“镜头跳跃感”

30秒短片里,镜头之间的景别节奏要设计过,不能随机抽。推荐一个基础节奏公式:

全景定环境 -> 中景进入人物 -> 近景给情绪 -> 特写给细节 -> 全景收束

如果连续三个镜头都是近景,观众会缺少“空间定位”。如果全是全景,又看不到情绪。真正有镜头感的片子,就是在这几个景别之间来回切换,而且切换原因都是“为了让观众注意什么”。

6.3 运动幅度不是越大越好

AI视频生成工具对大幅运动的处理能力有限。人物跑步、快速转身、镜头急推,都容易出现形变和闪烁。从工程角度看,建议:

  • 人物动作幅度控制在小到中等范围;
  • 优先使用“缓慢推近”“缓慢上摇”“固定镜头加人物移动”这类稳定性高的运镜;
  • 真正需要剧烈运动时,把动作拆成多段,中间用转场过渡。

在分镜阶段就设定好“每个镜头只有一到两个核心动作”,能显著提升成片率。

7. 第四步:批量生成镜头素材、剪辑与配音

当分镜脚本和人物设计都定了,就可以进入批量生产阶段。这个阶段最值得投入时间的不是素材生成本身,而是建立一套统一的文件命名和素材管理规范。

7.1 素材文件命名规范

推荐命名格式:

{项目名}_{镜号}_{版本号}.mp4

示例:

yuwang_gaobian_SC-001_v1.mp4 yuwang_gaobian_SC-001_v2.mp4

为什么要带版本号?因为AI生成经常需要抽卡。不带版本号时,改两版之后你就分不清哪个是最终版,剪辑时极其痛苦。

7.2 用Edge TTS快速生成配音脚本

配音是AI动画很容易“出戏”的环节。如果工具自带的音色不够有感情,可以先用Edge TTS批量生成小样,再进剪映精调。Edge TTS支持多个中文音色和语速调节,适合快速试听。

# 安装Edge TTS pip install edge-tts # 生成配音,指定音色、语速、输出文件 edge-tts --voice zh-CN-YunxiNeural --rate=-10% --text "五年了,我还记得这个路口。" --write-media sc001.mp3

这里选用zh-CN-YunxiNeural只是示例,也可以用其他音色。生成后关键一步是:把配音文件按镜号对应好,再剪掉多余空白。

7.3 用FFmpeg合并视频和音频

如果镜头已经导出为独立mp4片段,可以用FFmpeg做一次拼接。下面是一个基础示例,把SC-001到SC-003加上配音文件合成一段预览:

# 文件列表filelist.txt里按顺序写入 # file 'yuwang_gaobian_SC-001_v1.mp4' # file 'yuwang_gaobian_SC-002_v1.mp4' # file 'yuwang_gaobian_SC-003_v1.mp4' ffmpeg -f concat -safe 0 -i filelist.txt -i voice.mp3 -c:v libx264 -c:a aac -shortest preview_30s.mp4

如果镜头时长和配音时长不匹配,建议先按旁白节奏剪辑,再调整画面速度。不要上来就把每个镜头锁死成4秒,旁白长一点就露怯。

7.4 剪辑时机的把控

从流程上说,AI视频制作最合理的顺序是:

  1. 先配好旁白/配音;
  2. 按配音节奏切分镜时长;
  3. 再根据分镜时长去生成或剪辑画面;
  4. 最后加字幕、BGM和转场。

很多新手喜欢先生成一堆视频素材,再开剪辑软件硬拼。这样很容易出现“画面好看但节奏稀碎”的结果。

8. 实战案例:30秒都市奇幻AI短片全流程拆解

用一个30秒短片来串联前面的所有步骤。这是一个非常典型的信息流广告或者AI漫剧预告片场景。

8.1 故事设定

主题:主角阿远发现自己可以穿进旧照片,改变过去的一点小事,却导致现实发生巨变。

8.2 分镜脚本

镜号时长景别画面内容台词/旁白
SC-0013s全景雨夜旧城街道,阿远站在路灯下旁白:每张旧照片,都是一扇门。
SC-0023s近景阿远眼神从迷茫变为坚定旁白:我曾以为,改一个细节不会怎样。
SC-0035s中景阿远手触摸墙面上的黑白老照片旁白:但我忘了,过去是会反噬的。
SC-0045s特写照片中的人像眼睛动了一下无旁白,音效:心跳声
SC-0054s大全景城市在黄昏中扭曲,像胶片融化旁白:你准备好,付出代价了吗?

这份脚本只有5个镜头,但把背景、人物、冲突、悬念都交代清楚了。实际执行时可以从这个体量开始,先跑通,再扩成60秒。

8.3 关键执行顺序

  1. 先用第4节的JSON模板把分镜输出为结构化数据;
  2. 用第5节的方法生成主角阿远的固定角色描述,并生成角色定妆图;
  3. 每个镜头用“固定角色 + 场景 + 景别 + 动作 + 运镜”构造Prompt;
  4. 优先用参考图和图生视频生成镜头素材;
  5. 用Edge TTS按旁白生成音频;
  6. 在剪映里按旁白节奏排列镜头,加字幕、BGM和转场;
  7. 导出预览,检查人物一致性和镜头连贯性,不合格的镜头单独重抽。

9. AI视频制作常见问题与排查思路

新手最容易在下面几个问题上卡住。记住一个原则:先判断问题发生在“生成环节”还是“剪辑环节”,再动手重做,不要从头推倒。

问题现象可能原因排查方式解决方案
人物在下一个镜头里变样角色描述不统一,工具没吃透参考图检查每个镜头Prompt里的角色描述是否完全一致固定角色描述串;用角色参考图;降低模型想象力参数
视频生成后人物面部扭曲运动幅度过大,画面中主体太小换近景/特写镜头再生成减小运镜幅度,增加主体在画面中的占比
镜头之间光线不一致每张图用了不同的时间/天气描述在分镜脚本中统一定义光线关键词约定“暖黄路灯+冷蓝夜色+雨夜”全局风格
旁白与画面节奏对不上先剪了画面再配旁白回顾剪辑顺序改为先排旁白,再按旁白切镜头
生成结果总是带字幕水印反向提示词中没有屏蔽文字检查工具质量提示和负面提示词加入“无文字、无字幕、无水印、干净画面”
单个镜头好看但整体像PPT镜头之间没有动作衔接检查分镜是否有固定连续动作增加肢体动作、镜头运动,或加转场特效

如果镜头生成出来人物变了,建议优先重抽当前镜头,而不是全局调整。每次只改一个变量:要么改Prompt里的一处描述,要么换参考图,要么改运动幅度,直到找到稳定因素。

10. AI视频制作的最佳实践与变现建议

最后这部分,写给那些准备把AI动画当成作品集、兼职接单甚至团队项目的读者。

10.1 内容制作层面的最佳实践

第一,建立可复用的项目模板。把分镜JSON、角色描述符、Prompt拼接脚本、文件命名规范沉淀成一个固定模板,每次接新项目只替换项目名和故事内容。这样能大幅降低重复工作。

第二,素材库要分类管理。我建议按“角色”“场景”“表情”“动作”“道具素材”文件夹分类,方便后续复用。比如上个月设计的“雨夜街道”,这个月可能改个天气描述就能再用一次。

第三,成片率意识。AI视频不是一次成功,而是“批量生成-筛选-修复”的过程。给每个镜头批量生成多个候选再挑,比反复手动调参生成同一镜头更高效。

第四,版本回溯。每个阶段保存一个版本,脚本改到第3版时你突然觉得第1版更好,这种情况很常见。保留版本文件,比事后后悔更实际。

10.2 变现路径建议

AI视频制作的变现,并不只有“做号涨粉”这一条路。从实际市场看,比较常见的方向有:

变现方向适合谁关键要求
信息流广告素材能快速出片的人30秒以内,视觉冲击强
AI漫剧/短剧分账有叙事能力的人人物一致性要求高,集数多
外包接单全流程都能控制的人交付规范,修版本意识强
教程/知识付费流程经验丰富的人有可复制的SOP和案例
自有IP内容变现有选题能力的人稳定更新,内容差异化

无论选哪条路,最核心的能力都是“稳定交付”。客户不会因为你某条视频爆了就买单,但会因为“这次的脸和上次一模一样,不会崩”而信任你。

10.3 现阶段的学习顺序建议

如果你是从零开始,不建议一上来就学十种工具。按下面顺序推进:

  1. 先用通用大模型生成一个包含5个镜头的分镜脚本;
  2. 用任意一款绘图工具生成一张角色定妆图;
  3. 用图生视频工具把这张图变成一个5秒镜头;
  4. 用Edge TTS生成旁白,在剪映里拼成15秒短视频;
  5. 把流程跑通之后,再回头研究人物一致性和镜头语言优化。

不要把时间浪费在“囤积Prompt”上。同一个Prompt在不同模型、不同参考图、不同参数下的表现差异巨大。真正重要的是你能不能让角色连续出现在三个镜头里,并且让观众看完之后愿意把进度条拖回去再刷一遍。

AI视频工具会在未来一年内继续升级,但“内容工程化”这套思维方式不会过时。脚本先行、人物可控、镜头有依据、剪辑有节奏,这才是AI动画从“能出片”走向“能接单”的临界点。建议收藏这篇文章,下一部想做的短片,就照着这套流程跑一遍。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询