AI漫剧制作全流程拆解:从剧本、分镜到成片的避坑指南
2026/9/15 3:09:32 网站建设 项目流程

1. 内容整体设计与思路拆解

先说个现象。我从去年年底开始系统研究AI漫剧,到现在完整跑通了七八个案例,从最初一套分镜出三张废图,到如今基本能稳定出一条不露怯的短视频,中间踩的坑比我前五年写代码加起来都多。这篇文章就是把我跑通的全链路——剧本、分镜、静帧、视频生成、配音、剪辑——一件件拆开讲透,每个环节给你现成的模板、参数和避坑清单。

先说个扎心的事实:大多数新手做AI漫剧,不是输在不会用某个工具,而是输在不知道“每一步要做到什么程度才能进入下一步”。你花两小时磨出一张超精美的女主角立绘,结果到分镜阶段发现每个镜头都要重新描述一遍她的长相,表情还总崩——这就是典型的流程设计失误,把力气花错了地方。所以这篇文章第一部分,我先不讲具体操作,而是先把整个AI漫剧的制作链路给你摊开,讲清楚每一环的核心目标和交付物是什么。

AI漫剧的本质,是用AI工具以极低的成本完成传统动画工业里需要几十人协作的工序。传统漫剧是怎么做的?先有编剧写脚本,再有分镜师画分镜脚本,然后原画师做人设和场景设定,再交给动画师做动态,声优配音,最后剪辑合成。AI漫剧把这条流水线压缩成一个人的工作流:大模型帮你写剧本、改对白,AI绘画工具生成分镜草图和静帧画面,图生视频模型让画面动起来,语音合成给角色配音,最后用剪辑软件把素材拼成片子。不是每个环节都能省掉,但每个环节都能大幅提效。

基于这个逻辑,我把整个流程抽象成了五个交付物:剧本Word文档、分镜Excel表格、静帧图片素材库、视频片段文件夹、配音音频轨。每个交付物之间是有依赖关系的——分镜表必须能对应上剧本的每个镜头,静帧必须能对应上分镜表的每个格,视频必须对应上静帧的关键动作。很多新手做崩了,就是因为这个链条中间某一步断开了:分镜写了个“女主角愤怒地推开门”,结果静帧生成了二十张不同视角的图,没有一张是门正面的,后边视频就没法接。

我另一个体会是,AI漫剧的成败在前期设定,不在后期生成。你剧本里角色设定越具体,分镜拆得越碎,后边每个环节就越省心;你要是剧本只有“男主救女主”这种粗颗粒描述,到静帧阶段AI只能给你自由发挥,出来一堆不能用的大脸特写,那才是灾难。所以下面的实操篇,我会把“如何把剧本拆成分镜”“如何做角色设定表”这两个最容易被忽略的环节,放在最前面讲。

2. 核心细节解析与实操要点

2.1 剧本阶段:一次性把设定做扎实

剧本环节真正要交付的不是“故事”,而是“两套说明书”:一套给AI用,一套给自己用。

给AI用的,是你投喂给大模型的提示词。我常用的做法是:先让模型扮演编剧,基于一个一句话梗概扩写完整大纲,然后把大纲里每个场景再扩成“场景编号+场景地点+时间+出场角色+画面描述+对白+剧情提示”的结构化格式。初期不要直接让它生成完整对白文本,而是先让它生成“画面描述+对白提示”的分场表。比如“机场大厅,夜晚,男主拖着行李箱快步走向出口,看到女主站在接机口,两人对视,沉默三秒”,这一段画面描述出来,你后边做分镜就有抓手了。

给AI这套描述,有几个技巧实测下来很重要。第一,场景描述必须带光线和机位感。不要写“公司会议室”,要写“落地窗前的长会议桌,午后阳光从左侧打入,逆光形成轮廓光”。不是让你写摄影脚本,而是当你把这段文字喂给AI绘画工具时,它生成的光影方向会更统一,后期视频运动的明暗变化也更自然。第二,人物状态要写情绪,不只是写动作。“男主攥紧拳头”和“男主不知道说什么好,攥紧拳头又松开”是两个完全不同的画面,后者更能影响镜头节奏。

给自己用的说明书,是一张角色设定总表。这张表我会固定维护在一个文档里,包含每个角色的姓名、年龄、外貌关键词(发型、发色、瞳色、服装、配饰)、性格标签、说话风格。这张表在后边所有环节都会反复用到:写分镜时补充镜头细节,写静帧提示词时拼接描述,做视频时判断角色是否崩了。前面多花二十分钟把这张表做扎实,后面省两个小时。

我给一个自己常用的角色描述模板:

角色名:林晚 base:成年女性,25岁,长发及腰,深棕色直发,刘海偏分,琥珀色眼睛,高挑纤细 服装:米白色风衣、黑色高领毛衣、深蓝牛仔裤、白色帆布鞋 配饰:银色细链项链,右手腕一条红绳 风格标签:清冷、克制、微皱眉习惯

这段就是“可复用素材”。之后无论用哪款AI绘画工具,只要把这几个关键词拼进提示词里,就能稳定复现人物,剩下的是调整表情、角度和景别。

关于剧本长度我多说一句。新人第一次做,别一上来就搞三分钟五集连播。一集时长控制在30~60秒,大概是200~300字对白,或者60到90个短句,这种体量刚好能走完一整个流程而不至于崩溃。等你用这个体量把全流程跑通三遍,再考虑扩充成三集以上的系列。

2.2 分镜阶段:镜头感是AI漫剧的分水岭

分镜表是整条生产链的中枢。它连接着剧本的文字和静帧的画面,也是你后期剪辑的“剪辑脚本”。很多新手觉得分镜就是把剧本每一句拆出来配一张图,大错特错。分镜的质量直接决定了成片的节奏感,一些很简单的场景,如果你只给一张静态图,观众很快就审美疲劳;但如果你拆成“全景交代环境+中景展示动作+近景切表情”三张图,节奏一下就起来了。

我按“一镜一格”原则来拆。所谓一镜一格,就是每个行,代表一个镜头,且这个镜头内部不切换机位。比如“男主走进咖啡店,看到窗边的女主”这个动作,我会拆成三个镜头:

镜头1:全景,街道,前推,男主推开咖啡店玻璃门(2秒) 镜头2:中景,门内,侧拍,男主走进来,视线扫向窗边(2秒) 镜头3:近景,过肩视角,男主看到女主,停顿(2秒)

每个镜头控制在两到三秒,这是短视频的标准节奏。太长了观众划走,太短了观众看不清内容。如果不确定节奏,可以找几个爆款漫剧对照着拆解,把每一秒对应什么画面什么对白列出来,拆完三个就知道规律了。

分镜表里每个栏位有四个必须填的字段:景别、运镜、画面内容、时长。景别决定生成图时写什么镜头词,运镜决定视频生成时的运动参数,画面内容描述给静帧绘画工具,时长决定剪辑时视觉节奏。

我习惯用表格工具管理分镜表,每集一个sheet,表头是这样的:

镜头号景别运镜画面内容对白时长
01全景推近街道夜晚,男主站在路灯下看手机男主:她怎么还没来2.5s
02中景固定男主抬头,看到女主走来2s

这个表后边剪片子的时候就是导航,你按着它找素材、对画面、卡时长就行。分期表的紧要之处在于细致的画面描述写得越具体,后面的AI绘画和视频工具就越不会自由发挥,成片的稳定性立竿见影。

2.3 静帧阶段:先统一三件套,再谈风格

到了静帧环节,很多新手上来就纠结“用哪款模型”、“哪个风格好看”,但我建议先把三个基础参数统一了,否则画风一集一个样,剪辑时穿帮穿到怀疑人生。

第一是固定seed值。AI绘画软件里seed是随机数种子,决定了画面噪音的初始状态。同一条提示词,换了seed画出来的人物脸、衣服褶皱、背景构图都会变。尤其是用同一套角色提示词生成连续镜头时,必须锁定seed,才能让同一角色在不同画面里尽量接近。如果你用的工具没有seed参数,那至少要把同一角色对应的seed记下来并保持同一工作区重复使用。

第二是宽高比统一。竖屏短视频用9:16,横屏用16:9,千万别混着来。一旦混了,后边视频生成和剪辑阶段要么裁剪损失构图,要么拉伸变形。我见过不少人,静态图出了9:16,视频生成时工具锁定16:9,结果人物被左右拉胖,只能重新生成,白白浪费几个小时。

第三是画面色彩倾向统一。同一集里,尽量用相同的时间段和天气设定,比如都设定在“阴天下午”,或者都设定在“夜间暖色灯光”。AI绘画对太阳角度、色温的反应特别敏感,前一个镜头是正午,后一个镜头是黄昏,即使人物长得一模一样,观众也能察觉出违和感。

至于风格参考图,如果你用的是支持垫图或者参考图的工具,强烈建议挑一张你最喜欢的成图当作“风格锚点”,后续所有镜头都把这张图作为参考垫进去。这个做法比反复刷提示词要省事得多。

3. 实操过程与核心环节实现

3.1 静帧生成实操:提示词拼接公式

我实测下来最稳的静帧提示词结构,是下面这个“五段式拼接公式”:

[角色描述] + [服装细节] + [表情/动作] + [景别/镜头词] + [环境/氛围/画质词]

举例,接上面的角色林晚:

林晚,25岁女性,棕色长发琥珀色眼睛,穿米白风衣黑色高领毛衣,站在雨天霓虹灯下,转头看向镜头,表情平静带一点警惕,中景,胶片质感,电影感布光,柔光,8k画质

这里几个细节值得说下。第一,角色描述里的底色信息(年龄、发型、瞳色)每张图都要原样保留,一个字都别改;第二,景别词我会放在中间位置而不是最后,实测放在前面容易被模型忽略;第三,画质词放在最后,用来统一全集的渲染质感。

至于工具选择,Midjourney、Stable Diffusion、国内的可灵、即梦都在用,你要是新手建议从一个工具开始跑通流程再考虑横向对比。以Stable Diffusion为例,如果你有本地显卡,建议用SD 1.5或SDXL底座加上一个适合动漫风格的微调模型,打出好的底图后还要记得做第二步——局部重绘,人物面部如果崩了或手势不对,局部重绘是最快的修复方式。

再分享一个提高产出效率的高阶玩法:选好一款工具后,先批量生成“情绪/角度矩阵”。什么意思?就是拿同一套提示词,只改表情和角度词,一次性生成十几张角色同一姿态不同表情的图。比如“微笑”“皱眉”“惊讶”“侧脸”“回眸”“背影”,这些图单看不惊艳,但到了剪辑阶段,你会发现它们能嵌入任何情绪节点,大大降低后续视频生成出废片的次数。

3.2 图生视频实操:让静帧动起来

静帧只是中间态,AI漫剧真正的效果来自动态画面。图生视频工具现在已经很成熟了,主流选择有可灵、即梦、Runway、Pika等,各有特点。我的经验是:先定时长,再定运动方式

每次生成的视频时长尽量控制在5秒以内,这是目前大部分工具生成效果最稳定的区间。超过5秒,人物容易变形,动作容易失控。剪辑里需要长镜头的话,可以把多个5秒片段用叠化硬切接起来,观众感知不明显,但生成难度低了一个量级。

运动方式的选择,我一般遵循“能不动就不动,动则单方向”。什么意思?就是每个镜头只有一个主要运动方向,要么镜头推近,要么角色转头,要么风吹发丝,不要让画面同时发生两种以上的主要运动,AI模型一旦同时处理多运动就容易崩。人物转头+镜头推近,已经算高难度了,新手先别碰。

操作界面上,我一般会传一张静帧图片,然后在提示词里写运动描述。参考结构是:

[主要动作]+[次要动作]+[镜头运动]+[时间感]

例如这个镜头:

她缓缓抬头看向镜头,头发轻轻飘动,镜头缓慢推近,3-5秒

生成之后,我的例行动作是逐帧检视。把视频导入剪辑工具,一帧一帧地过,只看两件事:脸有没有崩、动作是否连续。脸崩了不能用作素材,因为后年如果大量用这种废片,整个视频会有恐怖谷效应。

还有个省钱省时间的小技巧:先用低分辨率快速出一版,确认动作、构图、表情对了,再调高分辨率重新生成高质量版本。你在低清版发现动作不对,直接改提示词重出,出的还是低清版,成本低;等确认没问题再花高倍成本出高清版,就不会浪费太多资源。

3.3 配音实操:先配音,再剪画面

我早期是从网站上下载现成配音,后来发现节奏对不上,情绪也拉胯,改成自己做配音之后再剪画面,整体质感提升非常明显。

第一次做AI漫剧的新手,我建议你在静帧阶段结束后、视频生成阶段开始前就把配音做掉。为什么?因为配音确定了每一句对白的准确时长,你在剪辑时就能“以声定画”——先放配音轨,再把对应的视频片段往上面对齐,节奏自然就对上了。而你如果先剪画面再配音,很容易出现画面0.5秒以后角色还没张嘴等问题。

配音工具现在的选择也不少。在线TTS流可以直接用剪映自带的,胜在便宜方便;要更细腻的情感表现,可以用ElevenLabs或GPT-SoVITS这类工具。实操层面,我建议你先做一条“白板轨”——用文本转语音把对白全录出来,音色、语速都放进去,然后用这条白板轨做剪辑草稿,定好每个画面的落位以后再用正式音色替换。白板轨就是你的“节拍器”,帮你管理画面的疏密和情绪的起伏。

再来一个关键点:配音要带画面感。你听很多爆款漫剧的对白,会发现每一句都极短,情绪也直接打成语言。这种“短句化”之后,剪辑更容易切镜头,观众停留时间也更长。写对白的时候,比如把“你今天怎么会突然来这里”改成“你怎么来了”,效果天差地别。

3.4 剪辑实操:对白轨先行,画面后置

剪辑环节我用的就是剪映,免费版基本够用。核心流程分三步:

第一步,导入配音轨。先把配音文件拖进去,然后把白板轨铺成一条主时间线,标记每句对白的起止时间。

第二步,按对白铺画面。打开分镜表,对照每个镜头的时长和对白位置,把对应的视频片段拖到时间线上。这里有个判断标准:镜头切换点尽量卡在情绪转折处,而不是卡在对白中间。“她回过头来”这句话说完的瞬间,就该切到她的表情特写,而不是继续停留在全景上。

第三步,加字幕、BGM、音效。字幕的关键是说话的人头上要有名字标识,不然观众搞不清楚谁在说话。BGM音量压到人声的1/3以下,音效以环境音为主,比如开门声、脚步、雷声,出现一点就足够过渡。

剪辑时还有一个通用原则:能用画面讲清楚的,就删掉对白。很多新手担心观众看不懂,恨不得每句话都说透,结果整个片子像是念稿子。我通常的做法是反复看三遍成片,把每一集里“去掉也完全不影响理解”的旁白切掉,节奏立刻舒服很多。

4. 常见问题与排查技巧实录

这里把我实操中最常遇到的六个问题整理成速查表,每个都是我真实踩过的坑:

问题表现根本原因解决方法
生成的人脸每张都不像角色描述词写得不够全或seed不固定把角色描述做成固定模板,每张图原样复用,锁定seed
同一个场景不同镜头颜色不一致色彩倾向设定不统一全集统一定时间段/天气,必要时用风格锚点图
视频里人物脸部扭曲变形图生视频时主体运动幅度太大拆成更短片段,每个镜头只保留一种主运动
生成视频动作像“PPT换图”静帧里没有运动趋势在提示词里写清动作和镜头运动,使用参考视频也可
配音和嘴型对不上先剪画面后配音调整为先配音,再按配音时间轴铺画面
一集内容太长导致半途弃坑脚本体量设计不合理单集控制在30~60秒,跑通流程后再加长

这些问题里,绝大部分都能通过“前移控制”解决,也就是把控制动作放到流程更早的环节中去:剧本阶段把场景描述具体化,分镜阶段把镜头运动和情绪写明白,静帧阶段锁定所有可复现参数,出图的废片量自然就少了。等到视频和剪辑阶段,更多是锦上添花,而不是勉强救场。

5. 这一套流程跑通以后,怎么提升上限

当你按上面的流程完整跑出一集,大概能体会到“能出片”和“能出好片”之间的差距。这个阶段再谈进阶,我的建议是往三个方向补:

第一是自动化工作流。把脚本编写开始到配音结束这几个环节尽量串联起来。现在很多AI工具都开放了API,也有类似AI Agent的工作流编排工具,可以把“读分镜表→生成提示词→批量出图→按固定模式生成视频”串成半自动流水线,早上起来点一下运行,晚上回来收素材,效率完全是质变。我不是说新手要一上来就搞自动化,而是在人工流程稳定后,再逐步外包给工具链处理机械重复的部分。

第二是建立自己的素材资产库。每一次跑流程生成的优质静帧、视频片段、配音文件,都按“项目/场景/角色/情绪”分类存档。攒两个月之后,再出新片子时,很多素材可以直接复用,甚至旧片段的背景、道具、服饰也能作为新片的新参考素材,省下大量生成和筛选时间。素材库的建立,是我觉得比任何高级技巧都划算的一步。

第三是训练专属风格LoRA或角色LoRA。如果你平时在Stable Diffusion生态里玩,可以拿你喜欢的角色设定图集去训练一个轻量级LoRA模型。这个模型训练好以后,你用简单的提示词就能生出一致性极高的人物,几乎告别抽卡。训练数据不用多,30~50张高质量角色图就能覆盖静态和动态画面里的多种角度。步骤不复杂,但非常吃耐心,建议在已经能稳定出片的基础上去尝试。

6. 写在最后的实操体会

我做了大半年的AI漫剧,最大的体会其实不是那些工具参数,而是一句话:AI漫剧拼的是流程管理,不是单张画面的惊艳度。很多人的废片是流程前段偷懒造成的——剧本里一句话写得不清楚,到了分镜就要发挥想象力补图,到了静帧就会出两张完全不同的图,到了视频就会动不起来,到了剪辑阶段就得硬凑。任何一个环节的省事,都会在后面的环节加倍偿还。

所以如果你看完这篇文章只记住一件事,我希望是“先打磨依赖关系再谈操作细节”。在你的第一个作品里,别急着追求画面多酷炫,先把人物一致性指标和镜头连贯性做好,把每一段的依赖关系理顺。这东西是越做越顺手的基本功,哪怕以后换再新的工具,这套思路都不过时。

最后再分享一个小习惯:每次跑完一个项目,用十分钟复盘一下,记下“这次哪张图生成得最满意,它前面的提示词是什么”“哪个镜头花了三次才成功,第一次和第三次改了什么”。攒下来的笔记就是自己最好的教程,比任何网上的“完整流程”都贴合你的需求。AI工具迭代比谁都快,但你的复盘笔记迭代得更快,这才是别人拿不走的核心竞争力。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询