Wan3.0视频提示词实战:从“描写画面”到“指导拍摄”
2026/9/23 22:27:33 网站建设 项目流程

Picsart 视频产品负责人最近分享的一组 Wan3.0 提示词技巧,核心观点不是“怎么把画面写得漂亮”,而是“怎么让模型像摄影师一样听懂拍摄指令”。这个判断我很认同。Wan3.0 是通义万相系列视频生成模型的新版本,很多人已经跑过文生视频、图生视频,但大部分生成结果不理想,问题往往不在模型能力,而在提示词写法。这篇文章就把这套思路拆开,给出一套可以直接实操的 Wan3.0 提示词框架,覆盖人物写实、产品展示、空镜氛围、风格化场景,以及从单条测试到批量任务的完整流程。适合两类人看:一类是刚接触 Wan3.0、被画面稳定性劝退的新手;另一类是想把视频生成接入内容生产流程、需要稳定输出质量的从业者。

先说一个容易误解的地方。视频提示词和对话提示词不一样。对话模型会理解你的意图,即使表述模糊也能猜。视频生成模型不会“猜”,它更像一个执行拍摄指令的团队:你写“一个女孩在森林里跑”,它可以生成,但场面调度、镜头运动、光线氛围、主体动作细节全部要模型自己脑补。脑补的结果就是不可控。所以真正值得花时间的,不是堆砌形容词,而是把提示词从“描写画面”改成“指导拍摄”。下面按实际落地顺序拆一遍。

1. Wan3.0 提示词厉害在哪儿:从“描写画面”到“指导拍摄”

1.1 这次分享里最值得学的一条

Picsart 视频产品负责人的分享,反复围绕一个点:把提示词当导演指令来写。视频产品团队每天都在跟生成结果打交道,他们最难接受的不是生成质量差,而是不可控。模型能不能把“主体是谁、在做什么、镜头怎么动、环境什么样”一次说清楚,直接决定一条视频能不能用。

为什么这个视角重要?因为 Wan3.0 本质上不是绘画工具,而是拍视频的工具。绘画提示词只需要描述静态画面,视频提示词要额外承担时间维度的信息:动作怎么发展、镜头怎么运动、情绪怎么变化。同一个画面,静止展示和缓慢推进,观众感受完全不同。模型需要从文本里读取这些差异。

1.2 提示词质量的分水岭:信息结构

我见过不少提示词写得非常饱满,形容词三十个,结果生成出来主体穿帮、镜头乱晃、背景闪烁。原因很简单:模型不知道哪些词是重点。提示词越长,重点越容易丢失。真正高质量的视频提示词,信息结构通常是清晰的,主体在开头,动作紧随其后,镜头语言单独交代,环境光线放中间,最后用约束条件收尾。

这里有个判断标准:把提示词读一遍,如果你能在脑子里直接想象出一个具体的分镜脚本,这条提示词大概率有效。如果读完还不知道主体是谁、镜头是固定还是运动、光线是暖是冷,模型更不知道。字数多不等于信息量大,一条好的提示词应该像一份简短的拍摄需求单,每个字段都有明确功能。

1.3 新手最常见的三类错误

第一类是写小说。把人物的心理活动、背景故事、隐喻全写进去。视频模型不理解“她看起来心事重重”,它理解的是“她皱眉、低头、沉默、缓慢转身”。视觉化的动词才有意义。

第二类是只说内容不说镜头。写了“一只猫在窗台上睡觉”,没有写镜头固定还是缓慢推近。模型自己选运镜方式,结果就是每次生成都不一样,风格不稳定。

第三类是只写正面描述,不写负面约束。视频生成里,手部变形、多手指、画面闪烁、文字水印都是高发问题。如果提示词里不写“不要出现手指变形、不要出现文字”,模型默认情况下不会自动避开。后面会专门讲负面提示词怎么用。

2. 写提示词之前,先理解 Wan3.0 怎么读文本

2.1 模型读的是“指令”,不是“文章”

Wan3.0 作为文生视频模型,输入是一段文本,输出是一段视频。它内部会把文本拆解成语义元素,再在视频生成过程中把这些元素组合起来。问题在于,自然语言天生有歧义。你写“一个男人走进房间,然后坐下”,模型要自己决定怎么走、怎么坐、镜头拍哪个角度。

所以好的做法是主动消歧:动作写具体,镜头写清楚,空间关系写明确。比如“一个穿黑色外套的男人从画面右侧缓步走进房间,镜头跟随他的背影,他在窗边的椅子上坐下,手指轻轻敲桌面”,模型需要脑补的部分就少很多。

2.2 它关注的信息层级

我通常把 Wan3.0 会读取的信息分成六个层级:

  • 主体:谁出现在画面里,长什么样,穿什么。
  • 动作:主体在做什么,动作幅度大还是小,有没有连续运动。
  • 镜头:镜头固定、推近、拉远、环绕、跟随、俯拍还是仰拍。
  • 环境:场景在哪里,背景是什么,空间关系如何。
  • 光线和氛围:自然光、暖黄灯、冷蓝、傍晚、清晨、雾天、霓虹。
  • 风格与约束:电影感、纪录片、动漫、写实、低多边形,以及不能出现的东西。

层级顺序很重要。主体和动作是第一优先级,如果这两项写得不清楚,后面的光线和风格再漂亮也没用。我见过很多人把光线写在最前面,主体反而一笔带过,生成结果往往是背景很有氛围,人物动作一塌糊涂。

2.3 中文提示词还是英文提示词

Wan 系列对中文提示词的支持一直做得比较友好。我的实测感受是,用中文写主体、动作、环境这些语义明确的内容,效果不比英文差,反而是中文表达“光线的暖冷”“风的大小”“动作的迟疑”这类细腻语义时更准确。选择原则就一条:用你自己表达最准确的语言,不要为了追求英文而生硬翻译。

如果要用英文,建议把关键名词和动作拆成短语,不要写成一整段复杂从句。比如“woman, 30 years old, gray coat, standing on rooftop, wind blowing hair, slow push-in”就比一整段嵌套从句更容易被模型解析。中文同理,短句、逗号分隔、信息块清晰,比长句更稳定。

2.4 别用写小说的方式写视频提示词

视频提示词里,最不值得写的是心理描写、抽象比喻、情绪形容词。比如“她心中充满孤独”,模型不知道孤独长什么样。改成“她站在空荡房间的窗前,双手垂在身侧,望着窗外暗淡的街道,镜头缓缓拉远”,孤独感反而表达出来了。

核心原则:所有情绪都要转化成可见的动作、表情、光线和环境。这也是 Picsart 视频产品负责人那套分享里反复强调的方向——用镜头语言替代文字描写,让模型通过画面元素来传达情绪。写提示词时多问自己:这句话能不能被摄像机拍到?拍不到就不要写。

3. 一套可复用的 Wan3.0 提示词框架

3.1 六要素结构

把提示词拆成六个模块,每一模块负责一件事。这个结构不是凭空发明的,而是从视频制作流程里反推出来的:任何一条可执行视频,都需要回答“拍谁、他在干什么、镜头怎么动、在哪儿、什么光、什么风格”。

  • 主体:一个不会产生歧义的对象描述。
  • 动作与情绪:具体的动作链条,按时间顺序排列。
  • 镜头语言:运镜方式、景别、视点。
  • 环境与空间:场景、背景、主体与背景的关系。
  • 光线与氛围:光线来源、色温、天气、时间段。
  • 负面约束:禁止出现的元素。

3.2 一个完整模板

下面这个模板可以作为起点,实际使用的时候替换掉方括号里的内容:

[主体描述],[服饰/外观细节],站在/坐在/穿行于[环境描述]。 动作:先[动作1],然后[动作2],表情[表情描述]。 镜头:[镜头运动方式],从[位置]开始,画面[景别],浅景深/深景深。 环境:背景是[背景描述],主体在[空间位置],画面角落有[辅助元素]。 光线:[光线来源]光,[冷/暖]色调,[时间段/天气]氛围。 风格:[电影感/纪录片/动漫/写实/低多边形],画面干净。 负面:不要出现[手指变形/多手多脚/文字/水印/闪烁/面部扭曲]。

注意,这不是一个固定格式,而是一个信息清单。模型不会因为你写了“负面”两个字就自动理解,真正起作用的是后面的具体内容。

3.3 模板拆解:每段在控制什么

主体描述放在开头,作用是锁定视频的主角。这一步写得不清楚,后续所有描述都容易跑偏。如果生成人物,最好写明性别、年龄段、服装、发型;如果是物品,写明材质、颜色、形态。不要只写“一个人”。

动作部分要按时间顺序写。视频是连续的,动作之间的先后关系必须明确。写“先推门,然后停顿,再走进室内”,比写“她推门走进室内”更容易生成连贯动作。动作幅度也要写:微微转身还是迅速回头,大步走还是缓步走,模型需要知道节奏。

镜头语言单独一段,不跟主体混在一起。我见过很多提示词把“镜头慢慢推进”写在句子里被模型忽略,原因就是它被其他长句淹没。把运镜方式单独列出,模型更可能响应。固定镜头就写“镜头固定”,运动镜头就写“缓慢推近”“跟随主体横移”“从俯拍缓慢下摇”。越具体越容易控制。

环境、光线、风格同样各有分工。环境解决“在哪”,光线解决“整体感受”,风格解决“渲染倾向”。三个模块最好都写,只写环境不写光线,画面容易平淡;只写风格不写环境,背景容易乱。

3.4 参数补充:时长、分辨率、运动幅度

提示词之外,Wan3.0 的参数也会影响结果。常见需要关注的有生成时长、分辨率和运动幅度。这些参数在不同产品界面里的叫法略有差异,但思路一致:视频越短,越容易控制;分辨率越高,对显存要求越高;运动幅度越大,越容易出现形变和闪烁。

我的建议是,第一次测试不要追求高分辨率,先用中低分辨率跑通提示词结构,确认主体、动作、镜头都符合预期,再拉高分辨率和时长。否则一条长视频跑到一半才发现主体穿帮,浪费的时间和资源都更多。如果界面里有“运动幅度”或“画面动态”类似选项,先从中等强度开始。运动太强,画面容易乱;运动太弱,视频又像静态图。

4. 分场景实测:人物、产品、空镜、动漫

4.1 人物写实场景

人物类视频是最常见的需求,也是提示词最难写的一类。难在三点:面部一致性、手部稳定性、动作连贯性。

一个实测下来比较稳定的人物提示词示例:

一个三十岁左右的女性,穿深灰色风衣,中长发,站在城市天台上。 动作:她站在栏杆边,双手扶着栏杆,风吹起头发,她微微侧头看向远方,然后缓缓转头看向镜头,眼神平静。 镜头:镜头固定在正前方,缓慢推近,从中景推近到近景,浅景深,背景略微虚化。 环境:背景是傍晚的城市街区,远处有暖色灯光逐渐亮起,天边是暗蓝色,画面左下角有轻微的车灯拖影。 光线:傍晚自然光,整体偏冷蓝色,面部有柔和补光,氛围安静克制。 风格:电影写实风,画面干净细腻。 负面:不要出现手指变形、多余肢体、面部扭曲、画面闪烁、任何文字或水印。

这条提示词的关键在于动作链条是连续的:扶栏杆、风吹头发、转头、看镜头,每一步都有明确顺序。镜头固定推近,让模型不必同时处理运镜和动作两件事。实测时如果脸部不稳定,优先缩短镜头推进距离,固定机位比复杂运镜更容易保住人脸一致性。

4.2 产品展示场景

产品展示视频讲究的是转台节奏、材质质感和环境反光。提示词要重点描写产品形态、表面材质、旋转方式和背景环境。

一个透明玻璃瓶装的无标签护肤品,瓶内是浅金色液体,瓶身有细微的水珠,放在浅灰色大理石台面上。 动作:瓶子缓慢旋转,顺时针转动约九十度,台面上出现轻微的光影移动。 镜头:镜头固定,从产品斜上方四十五度拍摄,缓慢推近,浅景深。 环境:背景是米白色墙面,台面边缘有柔和阴影,右侧放着一片绿色植物叶子,轻微入镜。 光线:柔和的棚拍灯光,偏暖白,产品表面有明显高光,玻璃材质通透。 风格:商业产品摄影风格,画面干净,质感细腻。 负面:不要出现手指、人物倒影、瓶身文字、水印、反光闪烁。

产品视频最容易出的问题就是瓶身文字和品牌标识乱生成。如果做不到精确文字,直接写“无标签”“瓶身没有任何文字”,比让模型自由发挥要稳得多。另外,旋转角度不要写太大,九十度以内的缓慢旋转比完整一圈更容易保持形态一致。

4.3 空镜氛围场景

空镜没有主体人物,难度在于氛围统一。这类提示词不需要复杂动作,重点写环境、光线和镜头运动。

一片雨后的森林,薄雾弥漫在树木之间,阳光从左上方的树叶缝隙中穿过,形成几道细长的光束。 动作:雾气缓慢飘动,树叶轻微摇晃,光束里的微尘浮动,没有人物。 镜头:镜头固定,缓慢向右平移,画面从树冠逐渐下摇到地面潮湿的落叶层,整体节奏很慢。 环境:森林地面被雨水打湿,落叶泛着湿润的深褐色,远处树木轮廓朦胧。 光线:清晨自然光,偏冷色调,带一点淡青色,氛围安静通透。 风格:自然纪录片的质感,画面干净,没有明显颗粒感。 负面:不要出现人物、动物、文字、水印、画面闪烁、过度饱和。

空镜类提示词,我最注意的是“动作”要写环境本身的动态,而不是主体动作。薄雾飘动、树叶摇晃、光束变化,这些细微运动会让画面活起来。如果你忘写环境运动,模型有概率生成一段近乎静止的视频,观感会像一张会呼吸的照片,而不是视频。

4.4 动漫和风格化场景

风格化视频的提示词,核心是明确“渲染风格”。动漫、水彩、赛博朋克、低多边形,不同风格对模型的影响非常大。同时要留意风格描述不要太杂,不要同时写“赛博朋克、宫崎骏风、厚涂油画风”,模型很难同时满足多个互相冲突的风格。

一个穿红色斗篷的少女,站在巨大的城市巨像脚下,巨像是古铜色机械结构,表面有发光纹理。 动作:少女仰头望向巨像,斗篷被风吹起,她向前走几步,镜头跟随她移动。 镜头:从低角度仰拍开始,缓慢上摇,然后切到侧面跟拍,镜头流畅连贯。 环境:城市巨像覆盖整片天空,脚下是布满青苔的石板路,周围有细小飞行物散发微弱的蓝色光点。 光线:黄昏暖光,巨像发光纹理呈蓝紫色,整体色彩对比强烈。 风格:赛博朋克动漫风,高细节,画面干净。 负面:不要出现真人脸、文字、水印、画面模糊、巨像结构扭曲。

这类风格的提示词,最容易失败的是“风格叠加过多”。我的经验是:风格词控制在两个以内,并且要兼容。赛博朋克和动漫可以兼容,水彩和写实就冲突。遇到生成结果风格跑偏,先检查风格词是不是太多。

4.5 每个场景的验证标准

跑完一次生成,不要只看“像不像”,要看四个标准:

  • 主体一致:人物身份、服装、发色是否从头到尾保持稳定。
  • 动作连贯:动作之间是否自然过渡,有没有跳变、瞬移、手部扭曲。
  • 镜头准确:运镜方式是否符合提示词,有没有莫名的镜头抖动。
  • 画面稳定:背景有没有闪烁,光线有没有跳变,有没有文字或水印。

只要某一个标准不达标,就算单帧截图再漂亮,也不能作为成片使用。这也是 Picsart 视频产品负责人那类分享里最常提到的判断维度:视频生成不是看单帧,而是看连续片段的稳定性。

5. 提示词写完之后,怎么判断效果对不对

5.1 先跑单条,不要直接批量

很多人拿到一套模板,马上把十个场景塞进去批量生成,结果问题一大片,还不知道哪条提示词出了问题。正确的顺序是先跑一条。

单条测试时,用中低分辨率、短时长,把提示词里所有要素过一遍。生成后逐帧检查,重点看第几秒开始出现崩坏。如果前两秒就崩,问题大概率在动作链条或主体描述;如果最后几秒才崩,可能是长视频累积误差,可以适当缩短生成时长。

这条单条测试的提示词,建议手动写,不要直接用模板自动替换。手动写能让你意识到哪些信息没写清楚,这一步的思考过程远比批量跑十条有价值。

5.2 效果不符合预期时,定位是哪一段的问题

提示词生成失败时,不要整条删掉重来。我一般用固定变量法:一次只改一个模块,其他模块不动,对比两次生成的差异。

比如主体描述没问题,但镜头很乱,那就只改镜头语言,把“镜头缓慢推近”改成“镜头固定”,其他词一个字都不动。如果画面稳定了,说明问题出在镜头描述。如果还是乱,那可能是环境描述太丰富导致模型注意力分散,把环境简化,保留光线即可。

这个方法的本质是给模型的注意力做减法。每次改一个变量,你能清楚知道哪个词真正生效。不要同时改三个模块,否则出了问题你根本不知道是谁的锅。

5.3 常见问题排查表

下面是我自己常用的排查顺序,从出现频率高到低排列:

现象优先排查项处理方式
主体穿帮、换脸主体描述是否清晰、是否用了参考图加面部特征描述;固定机位;降低运动幅度
手部变形动作是否写得太复杂简化动作;负面词加“手指变形、多余手指”
画面闪烁运动幅度过大、光线变化过强降低运动强度;固定光源描述
镜头乱晃运镜描述过于复杂改成单一运镜;先固定镜头再缓慢推近
背景乱入文字没有负面约束负面词加“任何文字、水印、字幕”
风格跑偏风格词冲突减少风格词;检查风格兼容性
动作不连贯动作链条没按时间顺序写用“先……然后……”的句式重写动作
画面太静态没有写环境动态加入雾、风、光、粒子等细微运动

排查时记住一个原则:先看输入,再看参数,最后才怀疑模型。大部分问题不是模型不行,而是提示词里某个模块没有尽到职责。

5.4 负面提示词的使用边界

负面提示词是很多人容易走极端的地方。有人写二十个负面词,结果画面被限制得毫无生气;有人完全不写,结果手指和文字乱飞。

我的建议是负面词控制在五到八个,只约束最影响使用的元素。常见的优先约束:手指变形、多余肢体、面部扭曲、文字水印、画面闪烁、风格混杂。少写“不要模糊”这类抽象负面词,因为“模糊”本身可能是某种风格的一部分。负面提示词应该写具体的、可识别的问题,而不是你的审美偏好。

6. 从单条到批量:提示词模板库和版本管理

6.1 为什么要建模板库

当你跑通了五到十条满意的提示词,一定要把它们存下来,而不是放在生成记录里等它过期。视频生成提示词调优的成本不低,每一条有效提示词都是积累。

我一般用表格维护提示词库,字段包括:场景类型、提示词原文、负面词、生成长度、分辨率、运动强度、验证结果、适合用途。这样下次要做类似项目,直接查库复用,而不是从头开始写。

模板库的核心价值是积累“已验证的稳定组合”。模型更新后,旧模板可能失效,但保留原始记录能帮你快速对比哪些部分发生了变化。

6.2 变量化提示词

模板库里的提示词最好做成变量式,而不是一整段复制。比如主体描述做成{subject},环境做成{environment},光线做成{lighting},其他结构保持不变。

一个{年龄性别描述}的人,穿{服装},在{环境}中{动作}。 镜头:{运镜方式},{景别}。 光线:{光线描述},{色调}。 风格:{风格描述}。 负面:{负面词列表}

这样做的好处是,批量生成时只需要替换变量值。比如同一套产品展示模板,把“玻璃瓶”换成“陶瓷杯”,把“大理石台面”换成“木质桌面”,一分钟能产出多条有差异但结构稳定的提示词。

6.3 输出命名和日志

批量生成时,输出文件命名一定要带变量信息。我建议格式是“场景类型_主体_环境_日期_序号”。这样跑完几十条,你扫一眼文件名就知道是哪组参数。不要用生成时间戳做文件名,不然排查时根本不知道哪条对应哪个提示词。

日志也很重要。每跑一组批量任务,把提示词版本、参数设置、输出文件列表、成功失败状态记下来。这一步看起来很麻烦,但等你要调整提示词时,日志能帮你快速定位“之前那次好的版本用的是哪个模板”。

6.4 批量任务的失败重试和一致性

批量生成视频和批量生成图片不一样,单条视频生成耗时明显更长,失败成本更高。启动批量任务之前,先确认三件事:单条成功率是否够高、输出目录是否有足够空间、失败后会不会自动跳过并记录日志。

如果批量任务里某条失败,不要简单重试一次就完。先把失败那条的提示词单独跑一遍,确认是提示词问题、参数问题还是临时资源问题。如果单条能跑通,再回到批量队列里重试。批量任务里连续失败超过三条,建议先停掉整个队列,排查原因后再继续。盲目重试只会浪费时间和算力。

最后说一点经验。Picsart 视频产品负责人那类分享,真正有价值的不是某条具体的万能提示词,而是一套稳定的工作方法:把提示词当成拍摄指令、用结构化模块控制生成、单条验证后再批量生产。Wan3.0 的能力边界也在不断变化,你手里的模板库和日志记录,才是应对变化最可靠的东西。按照上面的框架跑三到五条,你会明显感觉到提示词从“撞运气”变成了“可控制”的技术活。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询