做 AI 视频内容的人,应该都体会过两个让人头疼的问题:一是角色和场景难以保持一致,画面里的人物换个角度就像换了个人;二是视频生成了,还要另外找工具配音、配乐,再手动对齐音画,一条短片做下来要折腾好几个软件。如果你也在做短视频、广告分镜预览、角色动画或者创意实验,最近 Krea 上线 Wan 3.0 的这轮更新,可以关注一下。它把参考图数量提升到了 20 张,同时支持 30 秒带音频生成,这意味着“多角色一致性 + 长镜头叙事 + 声音设计”可以在一个流程里完成,而不再需要反复拼接素材。
这篇文章会围绕 Krea 平台中的 Wan 3.0 能力展开,先讲清楚这次更新解决了什么问题,再按完整的操作流程演示如何使用多参考图生成 30 秒带音频视频,接着给出提示词策略、常见报错排查方法,以及从生成素材到成片剪辑的工程建议。文章尽量覆盖从“没接触过”到“能上手做项目”的完整链路,适合视频创作者、AI 产品体验者,也适合需要把 AI 视频接入工作流的开发者和团队。
1. Wan 3.0 是什么,这次更新解决了什么问题
1.1 Krea 与 Wan 3.0 的关系
先解释一下背景。Krea 是一个面向创作者和设计团队的 AI 内容生成平台,提供图像生成、视频生成、实时生成等能力,用户可以在线完成从灵感草稿到成片素材的创作流程。Wan 则是视频生成模型体系中的一个系列,Wan 3.0 是它的新版本模型,可以把它理解为视频生成的“发动机”,而 Krea 是承载这辆车的“平台”。
两者结合之后,用户不需要自己部署模型,也不需要写复杂的调用代码,只需要在 Krea 的页面里上传参考图、填写提示词,就能完成视频生成。这对非算法背景的创作者非常友好,也让团队可以快速验证创意方案。
从版本迭代的角度看,Wan 3.0 的重点方向主要有三个:一是多图参考能力,模型在生成视频时可以参考多张图片来控制角色、物品、场景;二是视频时长延长,单段视频可以生成到 30 秒;三是生成结果自带音频,视频画面和声音在同一个阶段完成,而不是后期拼接。
1.2 三个核心更新点:20 参考图、30 秒时长、带音频生成
这次更新最直观的三个能力可以这么理解:
第一,20 张参考图。过去很多视频生成模型只能接受 1 张或少数几张图片作为参考,角色一旦换角度、换动作就容易变形。20 张参考图意味着用户可以提前准备一个角色在不同角度、不同表情、不同服装下的图片集,模型在生成时综合这些信息,保持角色特征稳定。这是做短片、动画、商品展示时非常实用的能力。
第二,30 秒视频时长。早期 AI 视频生成通常只有 5 秒到 15 秒,创作者需要把多个片段拼接起来才能组成完整叙事。30 秒相当于一个标准短视频的起步长度,可以容纳一个完整动作、一句完整的口播台词,或者一段有起承转合的镜头,叙事空间大了很多。
第三,带音频生成。生成的视频不仅包含画面,还包含音轨。音频可以是环境音、对白、配乐等,模型会尽量让声音与画面匹配。这样做的好处是效率高,不需要另找配音工具,也不需要手动对轨,拿到结果就是一条相对完整的视频素材。
1.3 本次更新适合哪些用户
从使用场景来看,这几类人会最先受益:
- 短视频创作者:需要快速制作口播视频、产品演示、剧情切片,30 秒带音频可以让内容直接进入剪辑流程。
- 品牌与广告团队:需要生成多套分镜预览,20 张参考图可以同时控制产品外观、模特形象和场景风格。
- 独立动画师与概念设计师:可以用参考图集保持角色一致性,减少逐帧重绘的工作量。
- 开发者和产品体验者:关注 AI 视频模型的产品化能力,验证多图参考 + 音频生成是否能应用到自己的项目里。
不过要提醒的是,这里说到的能力和参数,可能随平台迭代而调整。文章中的流程以当前 Krea 网页端的常见交互为参考,实际操作时以你登录后看到的界面为准。
2. 开始前需要准备什么
2.1 账号与订阅说明
在 Krea 上使用 Wan 3.0,首先需要一个 Krea 账号。注册方式以平台提供的渠道为准,通常使用邮箱即可完成。
关于订阅费用和生成额度,各平台的定价策略会经常调整,建议登录后查看当前账户的资源配额和 Wan 3.0 是否在你的套餐范围内。如果你是第一次使用,可以先在免费额度内测试一轮,确认生成效果符合预期后再考虑付费套餐。
这里也提醒团队用户:如果为了让更多成员使用,建议先确认团队成员是否需要共用账号,以及是否有权限管理、用量统计等需求;这些能力在不同平台上差异较大,不要默认所有平台都支持。
2.2 素材准备:参考图规范
准备参考图时,建议遵循下面几个原则:
第一,图片清晰度要足够。参考图是模型的约束条件,如果原图本身就模糊,模型很难还原细节。建议使用高清、无过度压缩的图片。
第二,主体要一致。所谓“角色一致性”,指的是多张参考图里出现的应该是同一个角色或同一个物体。如果第一张图是正面,第二张图是侧面,第三张图换了一套衣服,这没问题,但要保证五官特征、体型、材质风格一致。
第三,覆盖关键角度和关键状态。20 张参考图不是乱堆数量,而是要有规划。比如人物角色,建议准备正面、侧面、背面、半身、全身、不同表情、不同光线下的图片。产品展示则建议准备不同角度、不同背景、不同使用状态下的图片。
第四,注意背景和构图。如果不需要背景迁移,尽量使用干净背景的图片;如果需要保留某个场景,则准备该场景不同机位的图片。
2.3 建议的项目目录结构
不管是个人创作还是团队协作,素材管理都会直接影响效率。以视频项目为单位组织文件,是一个值得养成的习惯。下面是一个推荐的目录结构:
project_demo/ ├── reference_images/ │ ├── character/ │ │ ├── char_front.png │ │ ├── char_side.png │ │ ├── char_back.png │ │ └── char_fullbody.png │ ├── style/ │ │ ├── style_01.png │ │ └── style_02.png │ └── scene/ │ ├── scene_room.png │ └── scene_street.png ├── prompts/ │ ├── scene01.md │ └── scene02.md └── output/ ├── video_final/ └── audio_temp/这样做的好处是,当你需要生成一个新的镜头时,可以快速找到对应的角色图、场景图和风格图,而不是在一堆杂乱文件里翻找。后面我们讲到“提示词模板”时,这个目录结构也会派上用场。
3. 核心能力拆解与使用逻辑
3.1 多参考图是如何工作的
要理解 20 张参考图的意义,可以先回顾一下单张参考图的限制。单张参考图只能提供一个视角、一个状态的信息,模型在生成新镜头时,一旦涉及不同机位或不同动作,就很容易丢失角色特征。这也是为什么很多模型生成的同一角色在不同镜头里看起来不像同一个人。
多参考图的工作逻辑,是把一组图片当作一个“角色资料包”传给模型。模型需要从这些图片中提取稳定的身份特征,同时理解每张图片包含的额外信息,比如某个角度下的轮廓、某件衣服的纹理、某个场景的光线。生成视频时,模型会在保持这些特征的前提下,根据提示词控制动作和镜头运动。
从使用者的角度看,给模型提供的参考图越有组织性,模型提取到的信息就越稳定。你可以把参考图理解为“给美术师看的角色设定图集”,而不只是“给模型的随机图片”。因此,20 张参考图并不意味着越多越好,而是越“结构化”越好。
3.2 30 秒视频意味着什么
30 秒视频生成能力的价值,不只是“时间变长了”,而是让 AI 视频可以承担完整的叙事任务。
举个例子,过去做一条 30 秒的口播视频,需要先生成多个 5-10 秒的画面片段,再用剪辑软件拼接,同时还要处理画面衔接、音画同步、转场等问题。如果 Wan 3.0 可以直接生成 30 秒带音频的连续视频,那么很多剪辑工作可以前置到生成阶段,创作流程会明显缩短。
不过也要注意,30 秒视频在生成稳定性上的挑战更大。视频越长,角色形变、场景穿帮、动作不连贯的概率也会增加。因此,在实际使用中,建议先规划好画面内容,不要一开始就写一段非常复杂的动作描述,而是用清晰的提示词分段描述“角色在做什么、镜头如何运动、画面氛围如何”。
3.3 带音频生成的音画配合逻辑
带音频生成是这个版本很值得体验的功能。这里的“音频”通常包括环境音、对白、配乐或音效,具体支持哪些音频类型,以平台实际提供的选项为准。
从产品逻辑上说,带音频生成可以把“声音设计”纳入提示词工作流。也就是说,你不仅要在提示词里描述画面内容,还可以描述画面的声音属性,比如“这是一个安静的咖啡馆场景,远处有咖啡机的声音,背景音乐舒缓”。模型会在生成画面的同时,尝试生成与画面匹配的音频轨。
使用这项能力时,建议在提示词中写明音画的对应关系。比如“角色说话时,声音同步嘴唇动作;镜头转到街道时,环境音切换为车辆声”。这种描述越具体,生成的音画配合度越好。
如果你只是需要一条“有背景音乐的画面”而不是人物对白,那么提示词可以更简单一些,直接把音乐风格、情绪氛围写清楚,比如“轻快的电子音乐,节奏明显,适合产品展示”。
4. 在 Krea 中使用 Wan 3.0 的完整流程
4.1 第一步:整理角色参考图
在进入生成页面之前,先准备好参考图。假设我们要做一条 30 秒的产品展示视频,角色参考图就是产品本身,场景参考图是展示环境,风格参考图是整体色调。
操作上,你可以先建立一个项目文件夹,把所有图片放到reference_images/目录下,并对每个文件命名,例如product_front.png、product_side.png、product_detail.png。命名清晰不只是为了上传方便,更是为了后续在提示词中能准确描述“第几张图是什么”。
在 Krea 的生成页面,通常会有参考图上传区域。你可以在角色/物品栏位上传多张图片,也可以在同一组里上传更多参考图。具体一次能上传多少张,以平台界面的实际限制为准;这里说到的 20 张是指 Wan 3.0 的参考图容量上限,但在某些页面上平台可能出于性能考虑分为不同图片组上传,所以如果你看到多个上传框,可以按角色、场景、风格分类上传。
4.2 第二步:填写视频生成参数
上传完参考图后,接下来填写视频生成的参数。最主要的参数是提示词。提示词建议按“主体 + 动作 + 镜头 + 氛围 + 音频”的顺序来写,形成一个完整画面描述。比如:
产品展示视频。画面中心是一款黑色无线耳机,耳机从桌面缓缓旋转一周,镜头缓慢推近,背景是柔和的浅灰色摄影棚,光线温暖。产品表面有细腻的反光,科技感十足。音频:舒缓的电子背景音乐,音量适中,适合产品宣传。同时,时长选项选择 30 秒。如果界面支持视频比例、运动强度、画面风格等额外选项,可以根据需要调整。这里有一个建议:第一次生成时,先使用平台默认参数,目的是验证参考图是否被正确识别;确认效果稳定后,再逐步调整高级选项。
4.3 第三步:设置音频提示词与生成
如果你需要生成带音频的视频,注意填写音频相关的描述。音频提示词可以和画面提示词放在同一段文本中,也可以在音频设置区域单独填写,具体看平台界面。
音频描述建议包含四个要素:声音类型、情绪、节奏、音量关系。例如:
场景是一间窗边咖啡馆。画面中有水杯碰撞声、轻柔的爵士乐,远处有低声交谈声。音频整体音量较低,爵士乐作为背景,人声交谈作为环境音,不要盖过画面主体的动作声。填写完成后,点击生成按钮。Wan 3.0 生成 30 秒视频通常需要一定时间,页面一般会显示任务进度。生成过程中,建议保持页面打开,不要频繁刷新,否则可能中断任务状态显示。
4.4 第四步:结果筛选与导出
生成完成后,平台会返回结果视频。注意检查以下几点:
- 视频时长是否为 30 秒,或者接近 30 秒。
- 参考图中的主体是否保持一致,是否出现明显形变。
- 音频是否存在,音画是否同步,音频风格是否符合预期。
- 视频整体是否有穿帮、闪烁或画面断裂。
如果结果不满足要求,可以调整提示词后重新生成。这里建议不要一次性生成多个版本,而是先生成一条基线版本,再基于结果做微调,这样能更快定位问题。
确定满意的结果后,就可以导出视频文件。导出格式和分辨率以平台支持为准,建议优先导出高质量版本,方便后续剪辑。
5. 提示词与参考图策略示例
5.1 一套可复用的提示词模板
为了让生成结果更稳定,下面给出一套可以直接复制修改的提示词模板。它把画面信息拆成了几段,适合 30 秒带音频视频。
【项目名称】:XXX 产品宣传短片 【参考图说明】:第一张图是产品主视图,第二张图是产品侧面,第三张图是产品使用场景图,参考图用于控制产品外观和场景。 【画面内容】:产品从静止状态开始,缓缓旋转并移动到画面右侧。镜头跟随产品运动,保持中景构图。画面背景是现代化室内,墙面为浅色,桌面有反光。产品表面呈现金属质感,光影细节清晰。 【镜头语言】:开场为固定机位,2 秒后开始缓慢推近,8 秒处切换为侧面机位,15 秒处镜头拉远,展示产品整体与桌面环境。 【音频设计】:前 5 秒只有轻微环境音,之后音乐进入,节奏轻快,鼓点明确,整体音量在中等水平。产品旋转时有轻微的风声和电子音效。 【风格要求】:科技感、干净、明亮,色调以灰白蓝为主。使用这个模板时,把【】中的内容替换成你的实际项目信息即可。模板的核心思路是把“参考图说明 + 画面 + 镜头 + 音频 + 风格”分开,模型更容易理解每个部分的目标。
5.2 多张参考图的组合思路
20 张参考图的空间很大,但组合方式会影响最终效果。下面列出几种常见的组合策略:
| 策略 | 适用场景 | 说明 |
|---|---|---|
| 同角色多角度 | 人物动画、角色一致性 | 多张同一个角色的不同角度图,确保模型理解角色五官、体态 |
| 产品多状态 | 商品展示、广告分镜 | 产品开合、亮屏、多角度外观,确保产品细节不丢 |
| 场景多机位 | 场景漫游、镜头运动 | 同一场景不同位置的图片,帮助模型理解空间关系 |
| 风格混合 | 风格迁移、创意短片 | 参考图中既有主体图,也有风格参考图,要求模型融合 |
| 分角色组合 | 多人互动、对话场景 | 每个角色准备一组图片,生成时同时控制多个角色 |
使用时要记住一点:不是每张参考图都会被模型平均使用。模型会优先提取那些与提示词相关的信息。所以参考图要和提示词形成对应关系,不要上传和内容无关的图。
5.3 用本地脚本管理参考图与参数
当项目变多、参考图变多之后,手动上传很容易遗漏。这里提供一个简单的 Python 脚本思路,用来管理本地参考图和生成参数。注意这是一个示例脚本,用于本地文件管理,不涉及平台 API 调用。
import os import json # 项目根目录 project_dir = "project_demo/reference_images" def build_reference_manifest(project_root): manifest = { "character": [], "style": [], "scene": [] } for root, dirs, files in os.walk(project_root): # 根据目录名称分类 category = os.path.basename(root) for file in files: if file.lower().endswith((".png", ".jpg", ".jpeg", ".webp")): full_path = os.path.join(root, file) if category in manifest: manifest[category].append(full_path) else: manifest.setdefault(category, []).append(full_path) return manifest if __name__ == "__main__": manifest = build_reference_manifest(project_dir) with open("reference_manifest.json", "w", encoding="utf-8") as f: json.dump(manifest, f, ensure_ascii=False, indent=2) print("参考图清单生成完成")这个脚本会把reference_images目录下的图片按子目录名称分类,输出一个reference_manifest.json。当你准备上传参考图时,可以对照这个清单检查是否有遗漏。
对应的 JSON 输出结构大致如下:
{ "character": [ "project_demo/reference_images/character/char_front.png", "project_demo/reference_images/character/char_side.png" ], "style": [ "project_demo/reference_images/style/style_01.png" ], "scene": [ "project_demo/reference_images/scene/scene_room.png" ] }脚本的价值不在于自动化上传,而在于让素材管理可追踪。当项目团队协作时,一个清晰的清单可以减少沟通成本。
6. 常见问题与排查思路
6.1 参考图数量超过限制或上传失败
如果你上传参考图时提示失败,或者提示数量超过限制,可以先检查图片格式和大小。参考图的格式建议使用 PNG 或 JPG,文件大小不要过大。如果仍然失败,尝试减少单组上传数量,把图片分为“角色”“场景”“风格”等多个组分别上传。
另外,浏览器版本和缓存也可能影响上传。建议将浏览器更新到最新版本,上传前清一下缓存,或换一个浏览器尝试。
6.2 视频时长不足 30 秒
生成结果不足 30 秒,可能有两种原因:一是你选择的时长参数不是 30 秒,二是平台在当前模式下对某些用户或套餐设置了时长上限。建议先确认参数设置,再确认账户套餐包含的视频时长能力。如果只是因为平台限制,可以考虑升级套餐或使用其他支持的模型。
6.3 音画不同步或音频风格不对
音画不同步通常与提示词描述有关。生成时平台只能根据文本提示判断声音何时出现、何时结束,如果提示词只说“有背景音乐”,模型不容易精确对齐画面动作。建议在提示词里写明“第几秒出现什么声音”“声音和画面中的哪个动作对应”。
如果音频风格不对,则检查你是否说明了音乐类型、节奏和情绪。不要只写“音乐”,要写“舒缓的钢琴曲”“快节奏的电子音乐”“低沉的氛围音”。
6.4 生成等待时间过长
30 秒视频的生成时间本身就比较长,尤其是网络高峰期。如果任务长时间没有结果,先确认页面是否处于排队状态。部分平台在高并发时会限制任务数量。建议错峰生成,并避免同时提交多个任务;如果平台支持任务队列,可以查看队列状态。
6.5 画面出现角色漂移或形变
这是 AI 视频生成中最常见的问题。原因是参考图信息不稳定,或者提示词中动作描述超出了模型的能力范围。排查顺序如下:
| 问题现象 | 常见原因 | 解决思路 |
|---|---|---|
| 角色五官变化 | 参考图角度太少,特征不明确 | 增加正面、侧面、特写的参考图 |
| 产品细节丢失 | 产品多状态图不足 | 补充产品各角度、开合状态图 |
| 镜头切换后场景不一致 | 场景参考图数量不足 | 为每个主要场景准备多机位参考图 |
| 动作幅度大导致形变 | 描述的动作太复杂 | 简化动作为单一动作,或缩短镜头 |
| 画面闪烁、材质跳动 | 灯光和风格参考不统一 | 统一风格图,避免多重风格混用 |
在实际项目中,建议把生成长视频拆成多个镜头,每个镜头单独生成,再用剪辑工具拼接。这样既能保证单镜头质量,又能在镜头之间保持控制力。
7. 从生成到成片:下游工作流建议
7.1 视频剪辑中的音画同步处理
虽然 Wan 3.0 会生成带音频的视频,但在剪辑阶段仍然需要检查音画同步问题。生成结果中,音频轨可能与画面存在轻微偏移,这是 AI 生成视频目前常见的现象。
在剪辑工具中,可以先把视频的音频轨分离出来,找到明显的动作帧和声音峰值,再进行对齐。如果音频里有对白,建议用自动字幕工具生成字幕,再根据字幕位置检查音频是否与口型匹配。对于口型和声音不一致的情况,如果平台支持,可重新生成;如果只是轻微偏移,可在剪辑软件中微调音频轨位置。
7.2 批量生成与镜头衔接
对于需要多个镜头的项目,建议在生成前先写好一个“分镜表”,规划好每个镜头的时长、画面内容和音效。然后再为每个镜头单独准备参考图和提示词,逐个生成。
分镜表可以用表格记录,字段包括镜头编号、内容描述、参考图编号、音频需求、期望时长。这样做的好处是,当某个镜头需要重生成时,你可以快速找到对应的提示词和参数,不需要重新回忆。
7.3 生成内容版权与合规建议
使用生成视频时,有几个合规问题需要留意:
- 如果参考图包含真实人物肖像、品牌 Logo、商标、艺术作品,需要确认你是否有合法授权。
- 如果生成内容涉及他人版权保护的角色形象,请谨慎使用,避免侵权风险。
- 平台生成的内容可能有不同的使用授权条款,商用前建议阅读平台的用户协议。
这些原则不仅适用于 Krea,也适用于所有 AI 生成工具。创作者越早建立版权意识,项目后续的发布风险越低。
8. 最佳实践与工程师视角的几点总结
8.1 把参考图当成“角色设定文档”管理
参考图不是临时找来的素材,而是生成项目的核心资产。建议像管理代码仓库一样管理参考图,包括命名规范、版本记录和变更说明。
命名建议统一为“类型_内容_角度_版本”的格式,例如char_hero_front_v1.png。如果某个版本的生成效果好,可以在文件命名中标记_good_,方便后续快速找到可用素材。
8.2 沉淀提示词与生成参数
同一个项目里,多轮生成会产生不同的提示词变体。建议每轮生成都记录下提示词、参数、参考图列表和结果评价。这相当于给模型使用建立了一套可复用的“提示词资产库”。
下面是一个简单的记录模板,可以用 Markdown 文件保存:
镜头描述:产品旋转展示 参考图:char_front.png, char_side.png, scene_room.png 提示词:产品从桌面缓缓旋转,镜头推近…… 音频:舒缓电子音乐 参数:30 秒,默认比例 生成结果:角色稳定,音频稍轻 复现价值:高,参考图组合方式可直接复用当需要复现某种画面风格时,这套记录会非常节省时间。
8.3 理性看待“长视频 + 音频”能力
30 秒带音频生成确实大大简化了 AI 视频创作流程,但它不是万能的。目前的瓶颈仍然存在于复杂动作、多人互动、精确音画同步等场景。在实际项目中,最稳妥的做法是把长视频拆成可控的小镜头,分别生成后再进行后期处理。
对开发者和技术团队来说,如果你正在评估类似能力,可以从五个维度做评测:多图一致性、单段时长、音画同步率、生成稳定性、商用授权边界。结合自己的业务场景做测试,远比追着新功能跑更有价值。
如果你正准备用 Krea 和 Wan 3.0 做一条短片,建议从一个小项目开始,先做出一个 10 秒内的测试片段,验证参考图和提示词工作流,再逐步挑战 30 秒完整成片。把每一次失败都记录下来,你很快就能建立起一套属于自己团队的稳定生产流程。