简介:这份资源是一套面向AI内容创作者、短视频运营者与影视初学者的AI漫剧全流程制作方案,重点解决从零起步缺乏系统流程认知、各环节工具难以协同的问题。内容按前期策划、剧本创作、角色与场景设计、分镜制作、动画生成、配音配乐、后期合成到发布优化逐步展开,整合ChatGPT、Midjourney、Runway、ElevenLabs等工具,并给出提示词示例、种子值控制、分镜节奏与口型对位等可落地细节,适合制作1-3分钟竖屏短剧或打造系列化漫剧IP。资源包为1个docx文档,约20KB,以文字教程形式承载完整流程与操作要点,便于随时查阅对照实践。目前已有1184人学习,说明该流程在AI短剧创作群体中具备一定参考价值。读者可据此建立从剧本大纲、单集拆分、角色场景风格统一到成片导出与数据复盘的整体框架,减少试错成本,提升内容生产效率与完播表现。
1. AI漫剧全流程:从一张分镜到成片,普通人到底能不能跑通
你可能已经在短视频平台刷到过那种“漫画动起来”的短剧:画面是漫画风格,人物会眨眼、会转身、会打斗,配音配乐齐全,一集两三分钟,剧情连贯。这就是最近被反复讨论的 AI 漫剧。很多人第一反应是“这得专业团队吧”,但实际拆开看,它是一条可以被拆成若干标准环节的流水线:剧本拆解、角色设定、分镜生成、画面动效、配音配乐、剪辑合成。每个环节都有对应的工具和参数,难点不在单点技术,而在于环节之间的衔接和一致性控制。这篇内容面向想自己跑通全流程的从业者,不管你是做短剧、做漫画号,还是想接商单,我会把每个环节的选型理由、可抄作业的命令、参数怎么调、翻车点在哪,按顺序讲清楚。看完你至少能判断:这套方案值不值得投入,以及从哪一步开始动手。
2. 剧本拆解与角色设定:把文字变成可被 AI 消费的资产
2.1 为什么不能直接把小说丢给 AI 生成分镜
很多人第一步就翻车:把一篇三千字的小说直接扔给文生图模型,指望它自动生成连贯分镜。结果就是角色每张脸都不一样,场景跳来跳去,剧情节奏完全失控。原因很简单,文生图模型没有“记忆”,它不知道上一张图里主角穿什么颜色的衣服、站在什么位置。所以剧本拆解的核心任务,是把叙事文本转成结构化的、带约束的镜头描述。
常见做法是先用大语言模型做一轮“剧本结构化”。我一般会要求模型输出一个 JSON 数组,每个元素代表一个镜头,包含以下字段:镜头编号、场景描述、角色列表、角色动作、情绪基调、镜头类型(远景/中景/特写)、对话文本。这个 JSON 就是后续所有环节的“总谱”。参数上,温度建议设到 0.3 到 0.5,太高会导致镜头描述发散,太低又会让描述过于模板化。输出长度限制要放开,否则长剧本会被截断。
# 剧本结构化 prompt 示例(伪代码,实际调用任意 LLM API) prompt = """ 你是一个漫剧分镜师。请把下面的小说片段拆解成镜头列表。 输出 JSON 数组,每个镜头包含: - shot_id: 镜头编号,从 1 开始 - scene: 场景描述,包含时间、地点、氛围 - characters: 出场角色名列表 - action: 角色动作描述 - emotion: 情绪基调,如紧张、温馨、愤怒 - shot_type: 远景/中景/特写 - dialogue: 对话文本,没有则留空 小说片段: {novel_text} """ # 温度设为 0.4,max_tokens 设为 4000这段代码的关键在于字段定义要足够细。“场景描述”里必须包含时间、地点、氛围,因为后续文生图需要这些信息来保持背景一致性。“角色动作”要具体到肢体,不能只写“他很生气”,要写“他握紧拳头,眉头紧锁”。镜头类型决定了后续构图的宽高比和人物占比,特写镜头和远景镜头的提示词写法完全不同。
2.2 角色设定卡:解决“换脸”问题的唯一解
角色一致性是 AI 漫剧最大的玄学。同一个角色,第一镜是圆脸,第二镜变成尖脸,观众立刻出戏。解决办法不是反复抽卡,而是建立角色设定卡。每张卡包含:角色名、外貌特征(发型、发色、瞳色、脸型、体型)、服装描述(颜色、款式、材质)、标志性配饰。这些描述要固定成一段文本,每次生成该角色时原样拼进提示词。
更稳的做法是训练一个轻量级的角色 LoRA。如果不想训练,至少要用参考图 + IP-Adapter 或类似的面部锁定方案。参数上,LoRA 权重建议 0.6 到 0.8,太高会僵化,太低锁不住。参考图要选正面、光线均匀、无遮挡的半身像。我一般会为每个主要角色准备三张参考图:正面、侧面、半身,分别对应不同镜头角度。
{ "character_id": "hero_01", "name": "林远", "appearance": "黑色短发,剑眉,深棕色瞳孔,脸型偏瘦,身高约 180", "costume": "深蓝色立领外套,内搭白色衬衫,黑色长裤", "accessory": "左手腕戴银色金属手表", "reference_images": ["front.png", "side.png", "half_body.png"] }这个 JSON 结构可以直接被后续的提示词组装脚本读取。每次生成包含林远的镜头时,脚本自动把 appearance 和 costume 拼进正向提示词,把“不同发型、不同服装”放进负向提示词。这样即使模型有随机性,角色核心特征也能被锚定。注意,服装描述要避免模糊词,比如“休闲装”就不如“灰色连帽卫衣”来得稳定。
3. 分镜生成与画面动效:从静态图到“会动”的漫画
3.1 文生图提示词的结构化组装
有了剧本 JSON 和角色设定卡,下一步是批量生成分镜图。不要手动一张张写提示词,那样效率太低且容易漏掉角色特征。正确做法是写一个组装脚本,把镜头描述、角色设定、风格关键词拼成完整的提示词。风格关键词要统一,比如“日系漫画风格,赛璐璐上色,清晰线稿,柔和光影”,这一串要固定下来,所有镜头共用。
def build_prompt(shot, character_cards, style): # shot 是剧本 JSON 中的一个镜头对象 # character_cards 是角色名到设定卡的字典 parts = [style] parts.append(shot["scene"]) for name in shot["characters"]: card = character_cards[name] parts.append(f"{name}: {card['appearance']}, {card['costume']}, {card['accessory']}") parts.append(shot["action"]) parts.append(f"{shot['shot_type']}镜头") return ", ".join(parts) # 负向提示词统一为: negative = "不同发型, 不同服装, 多余手指, 扭曲面部, 模糊, 低分辨率, 水印"这段代码的逻辑是:风格在前,场景在中,角色特征紧随其后,动作和镜头类型收尾。参数上,采样步数建议 25 到 30,CFG scale 设 7 到 9。如果发现画面偏暗,可以在正向提示词里加“明亮光线”;如果人物脸崩,优先检查角色特征是否被后续词冲淡,可以把角色描述用括号加权,比如(黑色短发:1.2)。
3.2 让漫画动起来:图层拆分与补间
静态分镜图生成后,直接加个缩放平移只能算“伪动效”,观众看几秒就腻。真正让漫剧有质感的是局部动效:眨眼、口型、头发飘动、衣摆摆动。常见做法是把人物和背景拆成不同图层,人物再拆成头部、身体、手臂等部件。然后用动效工具做补间。如果不想手动拆层,可以用自动分割模型先跑一遍,再人工修正边缘。
参数上,眨眼动画一般 3 到 5 帧一个循环,口型根据配音音素映射,头发飘动幅度控制在 2 到 4 像素。动效时长要和对话时长对齐,一句 3 秒的台词,口型动画至少要有 6 到 8 个关键帧。我一般会先导出带透明通道的 PNG 序列,再在剪辑软件里合成。注意,图层拆分时边缘要留 1 到 2 像素的羽化,否则合成后会有白边。
# 用 ffmpeg 把 PNG 序列合成带透明通道的视频 ffmpeg -framerate 24 -i frame_%04d.png -c:v prores_ks -pix_fmt yuva444p10le output.mov这条命令生成的是带 Alpha 通道的 ProRes 视频,方便后续在剪辑软件里叠加背景。帧率设 24 或 30 都行,但要和后续剪辑工程一致。如果输出文件太大,可以改用 VP9 带透明通道的 WebM,但兼容性不如 ProRes。
4. 配音配乐与剪辑合成:把碎片拼成成片
4.1 配音:音色一致性和情绪匹配
AI 配音现在很成熟,但坑在于音色一致性。同一角色在不同集数里音色变了,观众会瞬间跳戏。解决办法是固定音色 ID,不要每次随机选。如果工具支持参考音频,就录一段 10 到 20 秒的干净人声作为音色锚点。情绪匹配上,不要只用“开心”“生气”这种粗标签,要结合剧本里的情绪基调字段,映射到具体的语速、音调、停顿参数。
| 情绪 | 语速 | 音调 | 停顿 |
|---|---|---|---|
| 紧张 | 加快 15% | 提高 10% | 短促,少停顿 |
| 温馨 | 放慢 10% | 降低 5% | 句尾稍长 |
| 愤怒 | 加快 20% | 提高 15% | 重音前停顿 |
| 悲伤 | 放慢 20% | 降低 10% | 多处短停顿 |
这张表是我自己调参时总结的,不同工具数值会有差异,但方向一致。配音导出后要检查响度,一般控制在 -16 LUFS 左右,和背景音乐做闪避处理。背景音乐音量在对话时降到 -20 dB 以下,无对话时恢复到 -12 dB 左右。
4.2 剪辑节奏:漫剧不是幻灯片
剪辑阶段最容易犯的错是把每个镜头拉得太长。漫剧的节奏比真人剧快,一个特写镜头 1.5 到 2 秒就够了,中景 2 到 3 秒,远景 3 到 4 秒。对话镜头要跟着语音波形切,一句话没说完不要切走。转场不要滥用特效,硬切最稳,偶尔用叠化或白闪。音效要铺满:脚步声、开门声、风声、环境底噪,这些能让画面“活”起来。
# 用 moviepy 按镜头时长自动拼接的简化逻辑 from moviepy.editor import ImageClip, concatenate_videoclips clips = [] for shot in shots: duration = shot["duration"] # 根据镜头类型预设的时长 clip = ImageClip(shot["image_path"]).set_duration(duration) clips.append(clip) final = concatenate_videoclips(clips, method="compose") final.write_videofile("rough_cut.mp4", fps=24)这段代码只是粗剪,实际还要叠加动效层、配音轨、音乐轨和音效轨。参数上,fps 保持 24 或 30,码率建议 8 到 12 Mbps,太低会糊,太高没必要。导出前检查音画同步,特别是口型动画和配音的对齐,差 2 帧以上就能看出来。
5. 避坑与排查:那些让我重做过三遍的翻车点
5.1 角色脸崩、服装跳变
现象:同一角色在连续镜头里脸型、发色、服装不一致。原因:提示词里角色描述被后续场景词稀释,或者模型随机性太高。解决:把角色描述用括号加权到 1.2 到 1.4,负向提示词里明确写“不同发型、不同服装、不同脸型”。如果还不行,就上 LoRA 或 IP-Adapter,不要硬抽卡。
5.2 动效边缘白边、锯齿
现象:人物图层叠加到背景后,边缘有一圈白边或锯齿。原因:抠图不干净,或者 PNG 序列的 Alpha 通道被压缩。解决:抠图后做 1 到 2 像素羽化,导出时用带 Alpha 的无损格式,比如 ProRes 4444 或 PNG 序列。不要用 JPEG 中间格式。
5.3 配音和口型对不上
现象:角色嘴在动,但声音已经结束了,或者声音还在继续嘴停了。原因:口型动画帧率和配音采样率不匹配,或者剪辑时音轨被移动。解决:统一用 24 fps 做动画,配音导出 WAV 后先对齐时间轴,再生成口型关键帧。剪辑时锁定音轨,不要误拖。
5.4 导出后画面变暗、颜色发灰
现象:剪辑软件里看着正常,导出后整体偏暗或偏灰。原因:色彩空间转换错误,常见于 Rec.709 和 sRGB 混用。解决:工程设置里明确色彩空间为 Rec.709,导出时选择对应的色彩标签。如果平台要求 sRGB,就在导出后做一次转换,不要直接在工程里改。
5.5 批量生成时显存爆掉
现象:跑了几十张图后程序崩溃,报显存不足。原因:每张图生成后没有释放缓存,或者批量大小设得太大。解决:每生成一批后手动调用清理,批量大小降到 1 到 2,分辨率不要超过 1024x1024。如果还不够,就用 CPU 卸载或分时段跑。
6. 进阶技巧:用参考图控制风格一致性
如果你已经跑通了基础流程,下一步要解决的是“整部剧风格统一”。光靠文字提示词很难做到,因为模型对“日系漫画风格”的理解每次都有偏差。更稳的方案是用参考图做风格锚定。具体做法是:选三到五张你满意的分镜图作为风格参考,用 IP-Adapter 或类似方案提取风格特征,然后在生成每一张新图时都带上这个风格参考。参数上,风格权重设 0.4 到 0.6,太高会让所有画面趋同,太低又没效果。
另一个技巧是建立“镜头模板库”。把常用的镜头构图(比如“两人对峙”“单人特写”“远景全景”)做成模板,每个模板固定一套提示词结构和参数。新剧本来了,先匹配模板,再替换角色和场景描述。这样既保证风格统一,又提高效率。我自己的模板库里有 12 个常用构图,覆盖了 80% 的镜头需求。
验证方法很简单:随机抽三集,让没看过的人判断是不是同一部剧。如果对方能一眼看出风格一致,说明你的锚定生效了。如果对方说“感觉像不同人做的”,那就回去检查风格参考图是否统一、权重是否稳定。这个方案值不值得做,取决于你想不想把 AI 漫剧从“玩票”变成“能持续产出”的流水线。如果只是做一两条试试水,手动抽卡也能凑合;但如果要周更甚至日更,上面这套结构化流程和一致性控制就是必选项。我自己的习惯是每做完一集,把这一集里所有用到的提示词、参数、参考图打包存档,下一集直接复用。这个后悔药,希望你永远用不上,但一旦翻车,它能救你。希望帮到你。
本文还有配套的精品资源,点击获取