最近半年,身边越来越多朋友开始做 AI 视频,有人用 AI 做古风短剧,有人做动物拟人动画,还有人在做产品宣传片。但大多数新手刚开始接触 AI 视频时,都会遇到同样的问题:网上教程非常多,但基本都是碎片化的,今天讲提示词,明天讲绘图工具,后天讲剪辑,真正能一条线走通“从文案到成片”的教程很少。结果就是看完了一堆教程,自己动手时还是不知道从哪一步开始。
这篇文章正好解决这个问题。我会以一条完整的 AI 短剧创作流程为主线,从前期构思、分镜脚本,到 AI 绘画生成画面、图生视频让画面动起来,再到配音配乐和剪辑成片,把每个环节需要用到的工具、提示词写法、参数设置和常见坑点都拆开讲清楚。零基础的新手可以按照步骤一步步操作,有视频剪辑经验的人也可以直接查阅提示词模板和工作流参数。
需要说明的是:AI 视频生成工具迭代非常快,不同平台的界面和参数可能每个月都在变。本文不会把某个工具的版本号写死,而是重点讲清楚底层逻辑和通用方法。你只要掌握这套方法论,无论工具怎么更新,都能快速迁移。
1. AI 视频创作到底是什么,为什么现在值得学
1.1 从概念说起:AI 视频创作的核心逻辑
AI 视频创作,通俗地说,就是用人工智能工具辅助甚至自动完成视频的制作过程。传统的视频制作流程是:写脚本 -> 实景拍摄 -> 后期剪辑。这个流程依赖摄影师、演员、灯光、场地、器材,成本高、周期长。而 AI 视频创作的流程变成了:写文案 -> AI 生成分镜画面 -> AI 让画面动起来 -> 剪辑配音配乐。
这里最关键的一点是:AI 不是替代你的创意,而是替代“执行层”的工作。你仍然是导演、编剧和剪辑师,只是原本需要扛摄影机、布光、找场地的环节,现在变成了写提示词、调参数。
1.2 AI 视频的主要应用场景
目前 AI 视频比较成熟的落地场景主要有这么几类:
| 场景 | 典型需求 | AI 视频的优势 |
|---|---|---|
| 短视频 / 短剧 | 古风、都市、悬疑、甜宠等剧情向内容 | 不需要演员和实景,制作成本大幅降低 |
| 产品宣传 | 数码、美妆、食品等产品的动态展示 | 快速出概念图,方便多方案比稿 |
| 知识科普 | 抽象概念的可视化解释 | 把不好拍的场景直接“画”出来 |
| 个人创作 | 音乐 MV、旅行 Vlog、梦境记录 | 创意表达空间大,容易出风格化效果 |
1.3 零基础入门的三个现实优势
第一,工具门槛在降低。现在很多 AI 视频工具都是网页版或客户端,不需要写代码,也不需要高配显卡就能用。第二,AI 绘画和视频生成的质量已经进入到“可商用”的临界点,只要提示词控制得好,画面质感已经接近实拍或传统三维渲染。第三,AI 短剧的商业化路径已经跑通,平台分成、广告植入、账号运营都有真实案例。
但也要有心理预期:AI 视频并非“输入一句话自动生成一部剧”。它需要你做剧本拆解、分镜设计、提示词调试、素材筛选、剪辑节奏把控。这些能力是可以逐步积累的,而且一旦掌握,它带来的效率提升非常明显。
2. 环境准备与工具选型:一条完整的 AI 视频生产线
2.1 工具矩阵:每个环节选什么工具
做 AI 视频,不需要在一棵树上吊死。合理的做法是按“脚本 - 绘画 - 视频 - 剪辑”四个环节,分别选择趁手的工具。下面是我目前测试下来比较顺手的组合,你可以根据自己的设备和预算调整:
| 环节 | 可选工具 | 说明 |
|---|---|---|
| 文案 / 脚本 | DeepSeek、ChatGPT、Kimi、通义千问 | 用大模型辅助写故事梗概、分场大纲 |
| AI 绘画 | Midjourney、Stable Diffusion WebUI、ComfyUI、国内聚合平台(即梦、可灵) | 生成高质量静态分镜 |
| 图生视频 | 可灵、即梦、Runway、Pika、ComfyUI 视频节点 | 让静态画面产生运动 |
| 剪辑合成 | 剪映、Premiere、CapCut | 完成粗剪、精剪、配音、字幕 |
这里要提醒一点:有些工具需要特定网络环境,这一点请自行理解,本文不展开。国内平台的好处是上手快、生态完整,但精细控制能力相对弱一些;Stable Diffusion 系的好处是开源、可控性强,但需要安装配置,对电脑配置有一定要求。
2.2 电脑配置与运行环境
如果你只在国内在线平台操作,那么一台普通能上网的电脑就够用,对显卡没有硬性要求。但如果你打算本地部署 Stable Diffusion 或 ComfyUI,建议参考以下配置:
- 操作系统:Windows 10/11 或 Ubuntu 20.04 以上
- 内存:16GB 起步,32GB 更稳
- 显卡:NVIDIA 显卡,显存 8GB 以上(推荐 12GB 或更高)
- 硬盘:SSD,预留至少 50GB 空间
- Python:3.10.x(本地部署时用,WebUI 通常自带环境)
版本这块不要照搬,因为 AI 绘画项目更新极快,建议去对应开源项目的 GitHub 仓库查看最新的环境要求。
2.3 素材规范:提前定好,效率翻倍
在正式开始创作之前,建议先统一素材规范,避免后面出图比例、时长、分辨率对不上,返工成本很高。
一个比较通用的规范如下:
- 画面比例:竖屏 9:16(1080x1920),适合抖音、快手、视频号;横屏 16:9(1920x1080),适合 B 站、西瓜。
- 出图分辨率:建议按最终视频的 1 倍或 2 倍生成,竖屏建议 1080x1920。
- 视频片段时长:单段图生视频建议 5 秒左右,便于后期剪辑组接。
- 文件命名:按“集数_场次_镜头号_画面描述”命名,例如
S01E03_02_01_女主转身.png。
3. AI 视频提示词工程:让 AI 听懂你的画面要求
3.1 提示词的基本结构
很多人第一次用 AI 绘画或 AI 视频工具时,只会输入“一个女孩在森林里走路”,结果出图效果非常随机,原因在于提示词缺少结构化表达。经过大量实践,我总结了下面这套提示词结构:
主体描述 + 环境场景 + 光影氛围 + 镜头语言 + 风格介质 + 画质关键词六个要素各司其职:
- 主体描述:画面主角是谁?什么长相、穿着、动作?这是提示词的核心。
- 环境场景:地点在哪里?背景有什么元素?
- 光影氛围:是清晨还是黄昏?是逆光还是顺光?情绪是温暖还是阴郁?
- 镜头语言:是特写、中景、全景?是推镜头还是摇镜头?
- 风格介质:是古风国漫、赛博朋克、写实真人、还是 3D 渲染?
- 画质关键词:常见的有 8K、ultra-detailed、masterpiece、best quality 等。
下面是一个正向提示词示例:
古风年轻女子,面容清秀,身穿月白色长裙,发髻精致,站在烟雨朦胧的江南水乡石桥上,手持油纸伞,回眸浅笑。黄昏暖光,细雨绵绵,背景是白墙黛瓦,水面有倒影。中景,平视视角,浅景深。唯美古风国漫风格,工笔质感。8K,超高清细节,电影级光影。3.2 负向提示词:告诉 AI 不要画什么
负向提示词往往比正向提示词更重要。AI 出图容易出现畸形手指、多余肢体、水印、糊脸等问题,通过负向提示词可以大幅降低概率。
低分辨率,模糊,变形的手,多手指,缺手指,肢体比例错误,脸部扭曲,水印,文字,logo,多余的肢体,画质差,噪点,饱和度异常。在大部分 WebUI 工具里,正向提示词和负向提示词是分开填写的。如果你用的是国内在线平台,它们通常会自动带一套默认负向提示词,新手阶段可以不用自己写。
3.3 图生视频提示词与文生视频提示词的区别
很多新手容易混淆文生图和图生视频的提示词。文生图,AI 是从无到有画一张图;而图生视频,是让一张已有的图产生运动,AI 需要知道的是“画面里什么东西在动、怎么动、镜头怎么动”,而不是重新描述一遍画面里有什么。
所以图生视频的提示词要聚焦在“运动”上:
镜头缓慢推进,女子发丝和裙摆随风轻柔飘动,雨丝下落,水面泛起涟漪,她缓缓转头,嘴角微微上扬。这个提示词里所有描述都是“动态”的,这是图生视频和文生图提示词最大的差异。如果你把静态描述原封不动地拿去做图生视频,AI 往往会因为不知道该动哪里,而生成一个几乎不动的静帧视频。
3.4 提示词模板:拿来就用的短剧分镜提示词
下面是一段适用于古风短剧的“分镜提示词包”,包含 5 个连续镜头,你可以直接复制到不同的生成任务里:
镜头1:古风男子一袭黑色劲装,站在悬崖边,风吹起衣角和发丝,眼神坚毅看向远方。阴天,山雾缭绕,冷色调。远景,无人机航拍视角,宏大苍凉。写实古装剧风格,电影感。 镜头2:男子面部特写,泪痕未干,眼神从悲痛转为决然,嘴唇微抿。窗外微弱烛光映在脸上,明暗对比强烈。浅景深,侧面光。写实电影风格,皮肤质感真实。 镜头3:女子在雨中奔跑,长裙湿透,脚下溅起水花,回头看向身后,惊慌与期盼交织。街道灯火通明,雨丝在灯光下闪烁。中景跟拍,动态模糊,手持镜头感。 镜头4:两人在庭院中对视,距离三步,风吹落白色花瓣,两人都没说话。午后阳光透过树叶洒落,光斑晃动。全景固定机位,构图对称,情绪克制。 镜头5:画面切到一只落在桌案上的玉佩,一只手缓缓拿起玉佩,指节泛白。暖光烛光,特写,极浅景深,镜头缓慢推近。这套提示词已经按“分镜”拆分好了,每句提示词都包含主体、动作、环境、光影、镜头、风格。你可以直接用它测试你手上的 AI 工具,看看效果,然后再改成自己的故事。
3.5 提示词调优与批量测试方法
写提示词不是一次就能成功的。我的经验是,先写一版完整提示词,跑出一批图后,再逐个删减或调整关键词,看哪个词对画面影响最大。
具体操作可以按这个流程来:
- 固定基础提示词,比如“古风女子,江南水乡,唯美风格”。
- 每次只调整一个变量,比如光影从“黄昏”改为“清晨”,其他不变。
- 对比输出图,记录哪个关键词带来了你想要的风格。
- 形成几个“风格锚点词”,之后所有同类画面都复用它。
这个方法也叫“单变量测试法”。它看起来简单,但能让你的提示词水平在短时间内明显提升,而不是每次都靠碰运气。
4. AI 绘画实战:从文字到高质量分镜底图
4.1 文生图的主要模式与参数
打开任意一个 AI 绘画工具后,你通常需要设置以下参数:
- 宽高比:短剧竖屏选 9:16,横屏选 16:9。
- 采样步数(Steps):20-30 是常见区间,步数越高细节越多,但过高反而不会有明显提升,还会拖慢速度。
- 提示词引导系数(CFG Scale):一般 5-9。数值越高,画面越贴合提示词,但太高会过曝或锐化过度。
- 生成数量:建议一次生成 4 张,方便挑选。
以 Stable Diffusion WebUI 为例,界面上的参数配置大致如下:
正向提示词:古风女子,江南水乡,黄昏暖光,中景,唯美古风,电影级光影,8K 负向提示词:低分辨率,模糊,变形的手,多手指,脸部扭曲,水印 采样步数:28 宽高比:832x1216(约 2:3,竖屏) 提示词引导系数:7 随机种子:-1(每次生成不同结果)如果你用的是国内在线平台,参数会简化很多,往往只需要选择图片比例和风格模型,生成逻辑是类似的。
4.2 人物一致性:AI 短剧绕不开的核心难题
做 AI 短剧与做单张 AI 绘画最大的区别在于:故事需要一个长相稳定、服装统一、气质一致的主角。如果男主角每换一个镜头就换了一张脸,观众立刻出戏。
解决人物一致性的常见方法有四种:
1. 固定种子(Seed)
在同一个工具里生成图片时,固定随机种子并复用同一组提示词,可以保持画面风格和人物基本特征稳定。这个方法实施起来最简单,但跨场景后效果不稳定。
2. 垫图 / 参考图模式
国内在线平台(即梦、可灵等)普遍支持上传参考图。你先生成一张满意的主角正脸图,之后每个分镜都上传这张图作为参考,让 AI 保持人物特征。适合新手,也是目前效率最高的方案。
3. ControlNet
Stable Diffusion 高级玩法。通过 OpenPose、Canny、Depth 等预处理器控制人物姿态、轮廓、景深,实现更强的结构控制。学习成本较高,但可控性最好。
4. LoRA 模型训练
在本地 Stable Diffusion 环境中,用几十张同一角色的图片训练一个小型 LoRA 模型。训练完成后,生成该角色只需调用这个 LoRA,效果最稳定,但需要时间成本和显卡资源。
对零基础新手,建议先用“固定种子+参考图”方案,成本低、见效快。等后面要系统做多集短剧时,再考虑 LoRA 训练。
4.3 人物三视图与角色设定图
如果你想做一个连载短剧,强烈建议先做一张角色设定图。角色设定图通常包含人物的正面、侧面、背面三个角度,以及服装细节、道具特征。这样后续每一个分镜都可以参考这张图生成,保证人物不会“变形”。
人物三视图提示词参考:
古风女子角色设定图,三个视角(正面、侧面、背面),全身像,浅灰色干净背景,站立姿态,身着月白色长裙,头戴简单玉簪,腰间挂一枚青玉佩。角色设计规范,游戏原画风格,细节清晰,人物表情温和,纯色背景,网格参考,工业设计展示图风格。生成这类图时,建议使用偏“角色设计”风格的模型,比如二次元或半写实模型,比直接写实更容易控制一致性。
4.4 出图后的筛选与抠图处理
AI 批量出图后,不能直接全部扔进视频工具。你需要做一轮筛选和基础处理:
- 筛选五官、手部、肢体都没有明显的畸变的图。
- 统一画面明暗和色调,避免相邻分镜差距过大。
- 如果画面中有多余元素,可以用修图工具(PS、美图秀秀、稿定等)做简单修复。
- 把每张分镜图按镜头顺序编号,方便图生视频时调用。
5. 图生视频实战:让静态分镜真正动起来
5.1 什么是图生视频,它的原理是什么
图生视频,简单来说,是上传一张图片作为起始帧,AI 根据你的运动提示词生成一段连续运动画面。当前主流工具还支持上传首帧、尾帧,AI 会填补中间的运动过程。
理解这个原理后,你就明白为什么图生视频的提示词要重点写“运动”:因为画面中哪些元素动、怎么动、镜头怎么动,这些信息是 AI 生成运动的关键。静态描述在视频模型里参考价值不大。
5.2 图生视频的基本操作流程
以目前主流平台的操作逻辑为例,流程通常是:
- 选择“图生视频”功能。
- 上传一张分镜底图。
- 填写运动提示词,描述画面中的动作和镜头运动。
- 设置运动幅度、画面比例、时长等参数。
- 点击生成,等待视频渲染。
图生视频的运动提示词,建议单独写,越具体越好。一个“所有东西都在动”的提示词,往往等于没有提示词。
5.3 图生视频运动提示词示例
下面这条提示词适合古风画面,你可以在你自己工具里试一下:
镜头从男子背影缓慢推近,衣袍被风吹起,发丝轻轻飘动,云雾在群山中缓缓流动,画面氛围静谧而深沉。人物表情保持沉静,只有细微的眼部变化,整体运动舒缓,电影级运镜。适合产品展示的提示词则完全不一样:
产品放置在旋转展示台上,逆时针缓慢旋转,背景光斑流动,微距镜头,产品表面光泽随角度变化,金属质感明显,浅景深。你会发现,图生视频提示词写得好不好,关键看你能不能区分“主体运动”和“镜头运动”,并且把动作节奏说清楚。
5.4 运动幅度与控制参数
大多数图生视频工具中有一个“运动幅度”或“运动强度”参数。这个参数直接决定画面变化幅度:
- 运动幅度低(0-3):适合人物表情、风吹发丝、细微的眼神变化。
- 运动幅度中(4-6):适合行走、转身、轻微动作。
- 运动幅度高(7-10):适合奔跑、打斗、大范围镜头运动,但画面变形的风险也会大幅提升。
新手建议从低运动幅度开始。低幅度即使翻车,画面也不至于完全没法用;幅度太高,人物脸部经常会产生严重形变,等于白做。
5.5 ComfyUI 图生视频进阶说明
对于有本地部署需求的开发者,目前开源社区里比较常见的是 ComfyUI 配合视频生成模型节点来做图生视频。这套方案的好处是完全没有平台限制,可以精细控制运动幅度、关键帧和输出格式,但配置过程相对繁琐,需要拉取多个模型和插件。
典型的 ComfyUI 图生视频工作流节点序列为:
加载模型 -> 编码参考图 -> 设置文本提示词 -> 设置视频长度与帧率 -> 设置运动参数 -> 批量生成 -> 解码输出视频注意,ComfyUI 的插件生态更新非常快,不同版本的节点名称可能发生变化。如果你在配置时遇到报错,优先检查节点版本的兼容性。这里不给出具体模型名称,是因为视频生成模型迭代速度太快,写几个月前的模型名称很可能误导读者,建议按你当前使用的社区教程为准。
6. 视听语言与分镜设计:让 AI 短剧不再是“图片轮播”
6.1 为什么需要懂一点视听语言
很多新手做出来的 AI 短剧,画面单看很精美,连起来看却像幻灯片。原因就是缺少视听语言思维。视听语言是视频创作的基本语法,它决定了观众如何理解画面、感受节奏。
对于 AI 短剧创作,最核心的三个概念是:景别、角度、运动。
6.2 常用景别与情绪效果
| 景别 | 画面范围 | 适用场景 | 情绪暗示 |
|---|---|---|---|
| 远景 | 人物很小,环境为主 | 交代环境、渲染氛围 | 孤独、浩瀚、命运感 |
| 全景 | 人物全身 | 展示动作与环境关系 | 客观叙事、信息交代 |
| 中景 | 人物膝盖以上 | 对话、交流 | 自然、日常 |
| 近景 | 人物胸部以上 | 表现情绪和表情 | 代入感、心理活动 |
| 特写 | 局部细节,如眼睛、手 | 强化情绪、关键道具 | 紧张、专注、情感冲击 |
AI 短剧常见错误是全程使用中景或近景,画面没有层次。建议在单元镜头里,至少交替安排 3 种景别,让视觉有变化。
6.3 镜头角度与运镜提示词
镜头角度能影响观众对角色的判断。俯拍会削弱角色的力量感,仰拍会增强角色的威压感,平视则产生平等代入感。在提示词里可以明确写:
- 俯拍:high angle shot,top-down view
- 仰拍:low angle shot,from below
- 平视:eye-level shot
运镜的提示词同样可以在 AI 工具里使用:
- 推镜头:camera slowly pushes in
- 拉镜头:camera slowly pulls out
- 摇镜头:camera pans left/right
- 移镜头:camera moves sideways
- 跟拍:camera follows character
- 环绕:camera orbits around character
6.4 AI 短剧分镜脚本模板
开始制作前,强烈建议用表格做一份分镜脚本。下面是一个可直接复制的模板:
| 场次 | 景别 | 画面描述 | 运镜 | 台词/旁白 | 音效 | 时长 |
|---|---|---|---|---|---|---|
| 1 | 远景 | 山崖边,男子黑衣远眺 | 慢推 | 旁白:三年了…… | 风声、悲壮配乐 | 5s |
| 2 | 特写 | 男子眼神从悲伤转为决然 | 固定 | 无 | 音乐渐强 | 3s |
| 3 | 中景 | 女子雨中奔跑回头 | 跟拍 | 女声:等等我! | 雨声、脚步 | 4s |
| 4 | 全景 | 两人对视,花瓣飘落 | 固定 | 无 | 音乐骤停 | 3s |
这一份表格做完后,后续的 AI 绘画、图生视频、剪辑全部以它为依据,你会有一种“心里有底”的感觉,而不是想到哪做到哪。
7. 剪辑成片:配音、配乐、字幕与导出
7.1 素材整理与命名
剪辑的第一步不是打开剪辑软件,而是整理素材。建议像下面这样组织文件夹结构:
project/ ├── 00_script/ # 分镜脚本、剧情文案 ├── 01_storyboard/ # 分镜图文件 ├── 02_video_clips/ # 图生视频生成的分段视频 ├── 03_audio/ # 配音、BGM、音效 ├── 04_output/ # 最终导出视频 └── 05_reference/ # 参考视频、风格参考图用剪映为例,把图生视频生成的分段素材按分镜顺序拖入轨道,再做粗剪。
7.2 粗剪与精剪的核心思路
粗剪阶段,只做一件事:把每个镜头的“可用区间”找出来。AI 生成的视频片段,开头和结尾很容易出现画面变化不自然的情况,尤其是人物脸部形变,一般发生在运动幅度较大的中间帧。所以粗剪时要把每个片段掐头去尾,只保留画面稳定的部分。
精剪阶段,重点控制节奏。一个普遍规律是:叙事镜头可以适当短一些,情绪镜头要留足。比如人物惊讶的表情,2 秒就够;两个人沉默对视,至少留 4 到 5 秒,情绪才出得来。
7.3 配音与配乐
AI 短剧的配音有两种方式:真人配音和 AI 配音。
- 真人配音:用手机或麦克风录制,感情最自然,推荐优先使用。
- AI 配音:用剪映自带的文本朗读、各类 TTS 工具生成,适合批量制作和预算有限的项目。
配乐方面,短视频平台的版权音乐需要谨慎,尽量使用平台提供的可商用音乐库,避免侵权。在剪映中,只需要把音乐素材拖入音轨,根据高潮点做淡入淡出。
7.4 字幕与导出设置
字幕要清晰,建议使用醒目的字体,但不要遮挡关键画面信息。剪映支持自动识别字幕,AI 短剧由于台词通常不多,识别后手动改一下错别字即可。
导出时,如果发布到抖音、快手,推荐以下设置:
分辨率:1080x1920 帧率:30fps 格式:MP4 (H.264) 码率:更高质量(文件较大但画质好)如果你用的是 Premiere,可以在导出窗口选择“匹配源”或“自定义”,手动输入以上参数。
8. 常见问题与排查思路
AI 视频创作过程中,几乎每个人都会遇到下面这些问题。这里汇总成一张排查表,方便你按图索骥。
| 问题现象 | 常见原因 | 解决思路 |
|---|---|---|
| 生成的人像脸部扭曲 | 运动幅度太高 | 降低运动幅度,尽量控制在 5 以下 |
| 人物眼神呆滞 | 图生视频提示词缺少“眼动”描述 | 在提示词中增加“眼球轻微转动”“眨眼” |
| 人物跨镜头长相不一致 | 没有使用参考图或固定种子 | 使用角色参考图模式,固定种子参数 |
| 画面像幻灯片,几乎不动 | 提示词只写了静态描述 | 改为写“动态运动描述”,如风吹、转身、镜头推近 |
| 生成视频大量拖影 | 画面中物体运动过快 | 降低运动幅度,或缩短单段视频时长 |
| 手部变形严重 | 原图手部结构有误 | 出图时筛选手部正常的分镜,再进入图生视频 |
| 剪辑后故事不连贯 | 分镜脚本设计不完整 | 回到分镜表,检查镜头之间的动作衔接 |
| 视频导出发糊 | 素材分辨率不足 | 出图时按 2 倍分辨率生成,剪辑前确认素材清晰 |
9. 工程化与合规:从玩一玩到稳定产出的关键
9.1 版权与素材合规
AI 生成内容目前存在版权边界争议,不同平台和国家的规定也不同。作为创作者,有几个基本底线必须守住:
- 不使用有版权争议的画作、图片、角色形象作为垫图。
- 不搬运、不模仿他人原创短剧的完整分镜和脚本。
- 发布平台已明确要求标注 AI 生成内容的,务必如实标注。
- 商业项目需要确认你使用的 AI 工具服务条款是否允许商用。
9.2 内容安全底线
技术本身没有立场,但创作者有责任。请避免使用 AI 视频生成低俗、暴力、侵权、误导性内容。很多平台对 AI 生成内容的审核越来越严格,不要为了一时流量去踩红线。这里特别提醒:网络上有大量号称“无限制”“无审核”的工具或提示词包,这些背后通常存在违规素材来源、账号安全和法律风险,不建议碰。
9.3 项目化管理与模板沉淀
当你从随机创作进入稳定更新阶段,建议建立自己的“素材银行”和“提示词模板库”。
我的做法是维护一个 AI 视频项目清单,用表格记录每个项目的核心信息:
| 项目名 | 类型 | 主角设定 | 分镜数 | 风格关键词 | 稳定工具 | 每集成本 |
|---|---|---|---|---|---|---|
| 古风短剧《月下》 | 连载 | 女主:月白裙+玉簪 | 28 | 唯美、工笔、暖光 | 即梦 + 剪映 | 约 10 元/集 |
| 宠物拟人动画 | 单集 | 橘猫大侠 | 16 | 3D 卡通、明快 | ComfyUI | 约 30 元/集 |
这样做有两个好处:一是方便复盘,不同类型的项目时间成本和效果一目了然;二是沉淀下来之后,下一部剧可以直接复用上一部剧的风格锚点词和人物设定模板,制作效率会成倍提升。
9.4 成本控制与效率建议
AI 视频真正的成本不只是工具会员费,更多是你的调试时间。建议大批量生成前用低价或免费模式测试提示词,确定风格后再用最高质量参数生成最终分镜。另外,同一张优质分镜图可以多次用于图生视频,尝试不同的运动角度,不要每次都重新生成底图。
10. 从单条爆款到长期更新的进阶路线
当你已经能独立完成一条完整的 AI 短剧后,下一步的成长方向有三条路:
第一条路是“单镜头 -> 多镜头 -> 系列短剧”。先把一个镜头做到极致,再挑战一段完整的情绪戏,最后再规划多集连载的剧情。不要一上来就做 10 集短剧,很容易因为工作量爆炸而放弃。
第二条路是“单一风格 -> 多风格切换”。先吃透一种风格,比如古风唯美,再尝试赛博朋克、治愈系、暗黑系。每种风格都需要不同的画面关键词、提示词结构和配音配乐逻辑,掌握越多风格,接单和变现的能力越强。
第三条路是“纯 AI 生成 -> AI + 实拍结合”。把 AI 生成的特效场景、虚拟人物与实拍镜头结合,这也是目前广告和影视行业正在尝试的方向。如果你能掌握把 AI 画面与实拍素材在色调、光照、构图上统一的方法,职业竞争力会非常明显。
最后给新手一个实际建议:不要等到把所有工具都研究透了再动手。AI 视频这个领域,工具永远在变,只有动手做过的东西才是你自己的。先用你手头最容易上手的工具,按照本文的流程做一条 30 秒的小短片,然后把它发到社交平台,让真实的反馈告诉你下一步该优化什么。
记住,AI 视频创作的竞争力不在于你用了多贵的工具,而在于你有没有把创意、提示词、画面、节奏和声音完整地组织成一个让人愿意看完的作品。这一点,和传统的视频创作本质上是一样的。