☰
文生视频提示词写作指南:五段式结构与ComfyUI实操
2026/10/2 5:43:32 网站建设 项目流程

1. 文生视频提示词到底在写什么

1.1 先搞清楚模型在“听”什么

很多人第一次接触AI视频生成,脑子里想的还是“我写一句话,它给我一段视频”。真上手之后才发现,同一句话在不同工具里出来的东西天差地别,有时候甚至同一个工具、同一句话,跑两次结果都不一样。问题出在哪儿?出在你以为你在“描述画面”,但模型实际在“解析结构”。

文生视频的提示词,本质上是一份给模型看的拍摄脚本。它需要同时告诉模型五件事:画面里有什么、这些东西长什么样、它们在怎么动、镜头怎么拍、整体是什么风格。这五个维度缺一个,模型就会自己“脑补”,而它脑补的方向往往和你想要的完全不是一回事。

我拿一个实际例子来说明。假设你想生成“一个女孩在海边散步”的视频。如果你只写这一句,模型大概率会给你一个中景固定镜头,女孩在画面中间匀速走,海浪微微动,整体像一张会动的照片。但如果你写成“广角镜头,低角度跟拍,一个穿白色连衣裙的女孩赤脚走在浅水区,裙摆被海风吹起,夕阳从她身后打过来形成逆光轮廓,海浪一层层涌上沙滩又退去”,出来的效果就完全不一样了。后者给了模型足够多的约束条件,它不需要猜,只需要执行。

这里有个关键认知:提示词不是越短越好,也不是越长越好,而是信息密度要够。所谓信息密度,就是每一个词都在给模型提供有效的约束。像“美丽的”“好看的”这种词,对模型来说几乎是噪声,因为它没有具体的视觉指向。而“逆光轮廓”“低角度跟拍”“裙摆被风吹起”这种词,每一个都在缩小模型的搜索空间。

1.2 不同工具对提示词的“理解方式”差异

MiniMax、可灵、Runway、ComfyUI 这几个工具,虽然都叫文生视频,但它们对提示词的解析逻辑差别很大。这个差别直接决定了你写提示词的策略。

MiniMax 和可灵属于云端闭源模型,它们的提示词解析更偏向“自然语言理解”。你写一段流畅的描述,它能抓住重点。这类工具通常对中文支持很好,你不需要刻意翻译成英文,直接用中文写就行。但它们对“镜头语言”的敏感度相对低一些,你写“推拉摇移”,它不一定能精确执行,更多是靠语义联想。

Runway 属于英文优先的云端模型,它的提示词解析更偏向“关键词匹配+语义组合”。你用英文写,效果通常比中文好。而且 Runway 对镜头术语的响应比较积极,像 “dolly in”“pan left”“tracking shot” 这类词,它是有专门训练的。

ComfyUI 则完全是另一套逻辑。它本身不是模型,而是一个节点式工作流引擎。你在 ComfyUI 里写提示词,实际上是在给某个具体的视频生成模型(比如 MiniMax H3、SVD、AnimateDiff 等)写输入。这意味着提示词的写法取决于你加载的是哪个模型。同一个 ComfyUI 工作流,换一个模型节点,提示词的风格可能就要跟着变。

提示:如果你刚开始接触文生视频,建议先用 MiniMax 或可灵这类云端工具练手,把“画面描述”的基本功打好,再去折腾 ComfyUI 的本地工作流。反过来先搞 ComfyUI,很容易被节点和参数淹没,反而忽略了提示词本身的质量。

1.3 提示词的基本结构:五段式写法

基于上面说的五个维度,我总结了一个比较通用的提示词结构,叫“五段式写法”。这个结构在 MiniMax、可灵、Runway 上都验证过,效果稳定。

第一段:主体描述。画面里最重要的那个东西是什么?人、动物、物体、场景?要具体到颜色、材质、外观特征。比如“一只橘色的短毛猫”就比“一只猫”好,“一只橘色的短毛猫,左耳有一个小缺口”就更精确。

第二段:动作与交互。主体在做什么?它和周围环境怎么互动?比如“猫从窗台上跳下来,落地时前爪先着地,尾巴向上翘起”。动作要具体到身体部位和运动方向。

第三段:环境与背景。场景是什么样的?光线从哪来?天气如何?比如“午后阳光从左侧窗户斜射进来,窗台上有一盆绿萝,背景是模糊的书架”。

第四段:镜头与构图。摄影机怎么拍?景别、角度、运动方式。比如“中景,平视角度,镜头缓慢向右平移”。

第五段:风格与画质。整体是什么调性?电影感、动画感、纪录片感?比如“电影级调色,浅景深,35mm 胶片质感”。

这五段不是必须严格按顺序写,但逻辑上要覆盖到。你可以把它们揉成一段流畅的话,也可以分段写。实测下来,分段写在 ComfyUI 里效果更稳定,因为很多工作流会把正面提示词和负面提示词分开处理,分段写方便你调整权重。

2. 核心细节解析与实操要点

2.1 主体描述:越具体越可控

主体描述是提示词的地基。地基没打好,后面镜头和风格写得再花哨也没用。我见过太多人写“一个美女在跳舞”,然后抱怨出来的视频脸崩、手崩、动作诡异。问题不在模型,在提示词太模糊。

具体到什么程度?我给你一个参考标准:如果你把这段描述给一个画师,他能不能在不问你的情况下画出符合你预期的画面?如果能,说明描述够具体了;如果不能,说明还有模糊地带。

拿“一个美女在跳舞”来说,画师肯定会问你:什么风格的美女?穿什么衣服?跳什么舞?在哪儿跳?光线怎么样?镜头从哪拍?这些问题,就是你需要写进提示词里的东西。

改写一下:“一个二十岁出头的亚洲女性,黑色长发扎成高马尾,穿红色运动背心和黑色紧身裤,在木质地板的工作室里跳街舞,动作利落有力,手臂和腿部线条清晰可见,汗水在灯光下微微反光。”这个描述就具体多了,模型能抓住的信息量完全不一样。

还有一个技巧:用“特征锚点”来稳定主体。所谓特征锚点,就是主体身上最独特、最容易识别的那个特征。比如“左耳有一个小缺口”“戴着一副圆框金丝眼镜”“穿着一件印有白色字母的黑色卫衣”。这些锚点能帮助模型在每一帧里保持主体的一致性,减少“变脸”的概率。

在 ComfyUI 里,如果你用的是 MiniMax H3 这类模型,主体描述还可以配合参考图来用。也就是所谓的“参考生视频”。这时候提示词里的主体描述要和参考图保持一致,否则模型会困惑:到底听文字的,还是听图片的?我的经验是,参考图负责“长相”,提示词负责“动作和场景”,分工明确,效果最好。

2.2 动作描述:动词的选择决定成败

动作描述是文生视频里最容易翻车的部分。因为视频和图片最大的区别就是“动”,而模型对动作的理解往往很粗糙。

先说什么样的动词不能用。“跳舞”“跑步”“打斗”这种大词,模型很难精确执行。它知道你在说一个动作类别,但不知道具体怎么做。出来的结果往往是“看起来像在跳舞,但说不上哪里怪”。

那用什么动词?用分解动作,用身体部位的动词。比如不说“跳舞”,说“右脚向前迈一步,重心下沉,左臂向上抬起,手腕翻转”。不说“跑步”,说“双腿交替蹬地,手臂前后摆动,身体微微前倾”。

这里有个实操技巧:动作描述要遵循“时间顺序”。模型对时间序列的理解是按你写的顺序来的。你先写“抬起右手”,再写“转身”,它就会先抬手再转身。如果你反过来写,它可能就同时做了,或者顺序乱了。

还有一个坑:动作幅度要合理。你写“跳起来三米高”,模型要么做不到,要么做出来像弹簧。你写“微微抬头”,它可能抬得太多。我的经验是,动作幅度用“轻微”“缓慢”“大幅度”这类程度词来修饰,比用具体数字更稳。

在可灵和 MiniMax 上,动作描述的响应比较好,因为它们的中文语义理解能力强。在 Runway 上,动作描述建议用英文,而且要用简单句,一个句子一个动作,不要用从句套从句。

2.3 镜头语言:让模型知道“怎么拍”

镜头语言是区分“业余”和“专业”提示词的分水岭。很多人写提示词只写画面内容,不写镜头,出来的视频就像监控录像——内容都对,但毫无美感。

镜头语言主要包含四个维度:景别、角度、运动、焦段。

景别就是画面里主体占多大。远景、全景、中景、近景、特写。这个直接决定了观众和主体的距离感。比如你想表现“孤独”,用远景,人在画面里很小;你想表现“紧张”,用特写,只拍眼睛或手。

角度就是摄影机从哪个方向拍。平视、俯视、仰视、斜角。俯视让人显得渺小,仰视让人显得高大,斜角增加动感。

运动就是摄影机怎么动。推、拉、摇、移、跟、升降。推是靠近,拉是远离,摇是原地转头,移是平移,跟是跟着主体走,升降是上下移动。

焦段就是广角还是长焦。广角视野大,有透视变形;长焦视野窄,有压缩感,背景虚化强。

在提示词里,你不需要把这四个维度都写全,但至少要写清楚景别和运动。比如“中景,镜头缓慢推进”就比什么都不写强很多。

注意:不同工具对镜头术语的识别能力不一样。MiniMax 和可灵对“推拉摇移”的识别还可以,但不如 Runway 精确。Runway 对 “dolly in”“pan left”“tracking shot” 这类英文术语响应很好。ComfyUI 里则取决于你用的模型节点,有些模型节点有专门的镜头控制参数,提示词里写不写镜头术语影响不大。

2.4 风格与画质:最后的“调色盘”

风格与画质是提示词的最后一段,但它的作用不容小觑。同样的画面内容和镜头,加上不同的风格词,出来的感觉完全不一样。

风格词主要分几类:艺术风格(油画、水彩、赛博朋克、蒸汽波)、媒介风格(胶片、数码、VHS、监控录像)、导演风格(诺兰式、韦斯·安德森式、宫崎骏式)、画质描述(4K、8K、超高清、电影级调色)。

这里有个坑:风格词不要堆太多。你写“赛博朋克+蒸汽波+油画+胶片”,模型会懵,出来的东西四不像。选一个主风格,最多加一个辅助风格,就够了。

画质描述也要适度。“4K”“8K”这种词,在有些模型上会触发过度锐化,反而显得假。我的经验是,用“电影级调色”“浅景深”“自然光”这类描述性词汇,比单纯堆分辨率数字更有效。

在 ComfyUI 里,风格词还可以通过 LoRA 来强化。比如你加载一个“胶片风格 LoRA”,提示词里再写“胶片质感”,两者叠加,效果更明显。但要注意 LoRA 的权重不要调太高,否则会覆盖掉其他信息。

3. 实操过程与核心环节实现

3.1 从零写一条完整提示词:分步拆解

光说理论没用,我带你走一遍完整的实操流程。假设我们要生成一段“一个男人在雨夜街头抽烟”的视频。

第一步:确定主体。男人,三十岁左右,穿深色风衣,短发,胡茬明显。手里夹着一支烟,烟头有火光。

第二步:确定动作。他站在街边,微微低头,把烟送到嘴边,吸一口,然后缓缓吐出烟雾。烟雾在雨中散开。

第三步:确定环境。夜晚,下雨,街道湿漉漉的,地面有积水反射霓虹灯光。背景是模糊的店铺招牌,暖黄色和冷蓝色交织。

第四步:确定镜头。中近景,平视角度,镜头从侧面拍,缓慢向前推进。景深较浅,背景虚化。

第五步:确定风格。电影感,黑色电影风格,高对比度,冷色调为主,暖色点缀。胶片颗粒感。

把这五步揉成一段完整的提示词:

“一个三十岁左右的男人,穿深色风衣,短发,胡茬明显,站在雨夜的街边。他微微低头,把烟送到嘴边,吸一口,缓缓吐出烟雾,烟雾在雨中散开。夜晚,下雨,街道湿漉漉的,地面积水反射着霓虹灯光,背景是模糊的店铺招牌,暖黄色和冷蓝色交织。中近景,平视角度,侧面拍摄,镜头缓慢向前推进,浅景深,背景虚化。电影感,黑色电影风格,高对比度,冷色调为主,暖色点缀,胶片颗粒感。”

这条提示词大概 150 字左右,信息密度足够,五个维度都覆盖到了。在 MiniMax 和可灵上实测,出片率比较高。

3.2 在 ComfyUI 里搭建文生视频工作流

ComfyUI 的工作流搭建是另一个维度的操作。很多人卡在“装好了但不知道怎么连节点”这一步。我梳理一下核心流程。

第一步:安装 ComfyUI。如果你不想手动配环境,可以用秋叶整合包。秋叶整合包的好处是依赖都打包好了,解压就能用。下载之后解压到一个非中文路径的文件夹,双击运行脚本,等它自动打开浏览器界面就行。

第二步:安装视频生成节点。ComfyUI 本身不带视频生成能力,你需要装对应的节点插件。比如你想用 MiniMax H3,就要装 MiniMax 的 ComfyUI 节点。通过 ComfyUI Manager 搜索安装是最方便的方式。Manager 里搜 “MiniMax”,找到对应的节点包,点安装,重启 ComfyUI。

第三步:下载模型。模型文件通常比较大,几个 GB 到十几个 GB 不等。下载之后放到 ComfyUI 的 models 文件夹对应子目录里。具体放哪个子目录,看节点说明。一般是models/checkpoints或models/diffusion_models。

第四步:搭建工作流。核心节点包括:模型加载节点、文本编码节点(正面提示词和负面提示词)、视频生成节点、视频保存节点。把这些节点拖到画布上,用连线连起来。模型加载节点的输出连到视频生成节点的模型输入,文本编码节点的输出连到视频生成节点的条件输入,视频生成节点的输出连到保存节点。

第五步:填写提示词和参数。在文本编码节点里填提示词。参数方面,视频长度、帧率、分辨率、采样步数、CFG 值这些都要设。视频长度一般 2-4 秒起步,帧率 8-16 帧,分辨率 512x512 或 768x768 起步。采样步数 20-30,CFG 7-12。

第六步:运行。点运行按钮,等进度条走完。第一次运行会比较慢,因为要加载模型。如果爆显存,就降低分辨率或视频长度。

提示:ComfyUI 生成视频时爆内存是常见问题。除了降低分辨率,还可以在启动脚本里加--lowvram或--medvram参数。另外,关掉其他占显存的程序也有帮助。

3.3 参数计算与选择:显存、分辨率、帧数的三角关系

ComfyUI 本地部署最头疼的就是显存不够。视频生成比图片生成吃显存得多,因为要同时处理多帧。这里有一个基本的计算公式:

显存占用 ≈ 分辨率面积 × 帧数 × 模型系数

模型系数取决于你用的模型。MiniMax H3 的系数大概在 0.5-1.0 之间,SVD 更高一些。假设你用 512x512 分辨率,16 帧,模型系数 0.8,那显存占用大概是 512×512×16×0.8 ≈ 3.3GB。这还没算模型本身加载占的显存。

如果你只有 8GB 显存,建议从 512x512、8 帧起步。跑通了再往上加。如果爆显存,优先降分辨率,因为分辨率对显存的影响是平方级的。帧数的影响是线性的,降帧数效果没那么明显。

还有一个技巧:用 MiniMax H3 的量化版。量化版模型体积更小,显存占用更低,画质损失在可接受范围内。比如 NVFP4 量化版,显存占用能降 30%-40%。但要注意,量化版可能需要特定的节点支持,装之前先看说明。

3.4 参考生视频的分镜写法

“参考生视频”是 MiniMax H3 的一个特色功能。你给一张参考图,再给一段提示词,模型会基于参考图里的人物或场景来生成视频。这个功能用好了,可以保持角色一致性,做系列视频很方便。

分镜写法的核心是:参考图负责“是谁”,提示词负责“在干嘛”。提示词里不要再重复描述参考图里已经有的东西,比如长相、服装。你只需要写动作、场景、镜头、风格。

举个例子。你有一张参考图,是一个穿红色连衣裙的女孩站在花园里。你想生成她转身微笑的视频。提示词就写:“女孩缓缓转身,面向镜头,露出微笑。镜头从中景缓慢推进到近景。阳光从侧面打过来,背景花朵微微晃动。电影感,浅景深。”

不要写“一个穿红色连衣裙的女孩”,因为参考图已经告诉模型了。你重复写反而可能让模型困惑:到底以哪个为准?

还有一个细节:参考图和提示词的风格要一致。如果参考图是写实风格,提示词里写“动漫风格”,出来的东西会很怪。模型会试图在两者之间找平衡,结果两边都不像。

4. 常见问题与排查技巧实录

4.1 画面崩坏:脸崩、手崩、肢体扭曲

这是文生视频最常见的问题,没有之一。原因通常有三个:提示词太模糊、模型能力不够、参数设置不当。

排查思路:先看提示词里有没有具体描述主体的外观特征。如果只写“一个人”,模型就自由发挥,脸崩的概率很高。加上“亚洲女性,黑色长发,圆脸,戴眼镜”这类描述,崩的概率会降低。

如果提示词没问题,那就是模型能力问题。有些模型在人脸和手部细节上就是弱项。这时候可以试试换模型,或者在 ComfyUI 里加一个面部修复节点。

参数方面,CFG 值太高会导致画面过饱和、崩坏。试试把 CFG 从 12 降到 7-9。采样步数太低也会导致画面粗糙,提到 25-30 试试。

4.2 动作不自然:像幻灯片、像鬼畜

动作不自然通常是因为帧数太低或提示词里的动作描述太笼统。帧数低于 8 帧,看起来就像幻灯片。提到 12-16 帧会好很多。

提示词方面,把“跳舞”改成具体的身体部位动作,比如“左臂抬起,右腿向前迈一步,身体微微旋转”。模型对具体动作的响应比笼统动作好得多。

还有一个原因:视频长度太长。有些模型在生成超过 4 秒的视频时,后半段动作会开始重复或扭曲。试试缩短到 2-3 秒,或者分段生成再拼接。

4.3 ComfyUI 报错:CLIP 不匹配、节点缺失、爆显存

ComfyUI 的报错信息有时候很晦涩,我整理了几个常见的。

CLIP 不匹配:通常是因为你下载的模型和节点要求的 CLIP 版本不一致。比如 MiniMax H3 量化版 clip5120 与 4096 不匹配的问题,解决办法是下载对应版本的 CLIP 模型,放到正确的目录里。或者换一个节点版本。

节点缺失:打开工作流时提示某个节点是红色的,说明你没装对应的插件。通过 ComfyUI Manager 搜索缺失的节点包名,安装后重启。

爆显存:前面说过,降分辨率、降帧数、加--lowvram参数。还有一个技巧是关掉 ComfyUI 的预览功能,减少显存占用。

生成到一半卡住:可能是模型文件损坏,重新下载。也可能是硬盘空间不足,清理一下。

4.4 常见问题速查表

问题现象可能原因解决办法
脸崩、手崩提示词太模糊加具体外观描述
动作像幻灯片帧数太低提到 12-16 帧
动作鬼畜视频太长缩短到 2-3 秒
CLIP 不匹配模型版本不对下载对应 CLIP
节点红色插件缺失Manager 安装
爆显存分辨率太高降到 512x512
生成卡住模型损坏重新下载
画面过饱和CFG 太高降到 7-9
画面粗糙步数太低提到 25-30
风格四不像风格词太多只留一个主风格

4.5 独家避坑技巧

技巧一:负面提示词不要偷懒。很多人只写正面提示词,负面提示词留空。其实负面提示词对画质影响很大。常用的负面词包括:模糊、变形、扭曲、多余的手指、多余的手臂、文字、水印、低画质。在 ComfyUI 里,负面提示词是单独一个节点,填进去就行。

技巧二:提示词权重可以手动调。在 ComfyUI 里,用(关键词:权重)的格式来调整某个词的重要性。比如(红色连衣裙:1.3)会让红色连衣裙更突出。权重范围一般 0.5-1.5,太高会崩。

技巧三:种子固定法。如果你生成了一条比较满意的视频,想微调提示词再生成类似的,可以固定种子值。这样模型会在同一个随机起点上生成,变化不会太大。

技巧四:分段生成再拼接。对于超过 4 秒的视频,与其一次性生成,不如分成几段生成,每段 2-3 秒,然后用剪辑软件拼接。这样每段的画质和动作都更可控。

技巧五:参考图的质量决定参考生视频的质量。参考图越清晰、主体越突出、背景越干净,生成效果越好。如果参考图本身就很糊,模型也救不回来。

4.6 工具选型:什么场景用什么工具

最后说一下工具选型。不同工具适合不同场景,没有哪个是万能的。

工具适合场景优势劣势
MiniMax中文提示词、快速出片中文理解好、上手快镜头控制弱
可灵中文提示词、人物动作动作自然、画质好排队慢
Runway英文提示词、镜头控制镜头精确、风格多中文支持差
ComfyUI本地部署、深度定制完全可控、免费门槛高、吃硬件

我的建议是:日常快速出片用 MiniMax 或可灵,需要精确镜头控制用 Runway,需要批量生成或深度定制用 ComfyUI。三者不冲突,可以搭配使用。

提示:ComfyUI 的秋叶整合包更新比较频繁,建议关注更新日志。有时候新版本会修复一些显存泄漏的问题,或者增加对新模型的支持。但也不要盲目追新,稳定版往往比最新版更可靠。

4.7 关于“无违禁词”的说明

网上有些人在搜“无违禁词AI视频生成软件”,这个思路本身就有问题。任何正规的AI视频生成工具都有内容审核机制,这是行业惯例,也是为了保护用户。与其琢磨怎么绕开审核,不如把精力放在提升提示词质量上。好的提示词能让模型在合规范围内生成高质量的内容,这才是正道。

另外,有些工具对某些词汇比较敏感,比如涉及暴力、血腥、成人内容的词。这些词你写了也没用,模型会直接拒绝生成。所以写提示词的时候,尽量用中性、描述性的语言,不要用带有强烈情绪或暗示的词汇。

5. 提示词进阶:从“能用”到“好用”

5.1 用“镜头脚本”思维写提示词

当你把五段式写法练熟之后,可以尝试进阶玩法:用“镜头脚本”的思维来写提示词。所谓镜头脚本,就是像拍电影一样,把视频拆成几个镜头,每个镜头单独写提示词,然后分别生成,最后剪辑在一起。

比如你要做一个 10 秒的短片,可以拆成三个镜头:镜头一,远景,城市天际线,日出;镜头二,中景,主角站在天台边缘,风吹动衣角;镜头三,特写,主角的眼睛,瞳孔里有城市的倒影。每个镜头写一条提示词,分别生成 3-4 秒的视频,再用剪辑软件拼接。

这种做法的好处是,每个镜头的画质和动作都更可控,而且可以通过剪辑产生节奏感。缺点是工作量大,适合对质量要求高的项目。

5.2 提示词的“迭代优化”方法

没有人能一次写出完美的提示词。好的提示词都是迭代出来的。我的迭代方法是:每次只改一个变量。

第一版生成之后,看哪里不满意。如果是主体不对,就改主体描述;如果是动作不对,就改动作描述;如果是风格不对,就改风格词。不要一次改好几个地方,否则你分不清是哪个改动起了作用。

每次改完之后,记录下改动内容和生成结果。积累多了,你就有了自己的“提示词-效果”对照表,下次写类似场景的时候可以直接参考。

5.3 跨工具提示词迁移的注意事项

有时候你在 MiniMax 上写了一条很好的提示词,想搬到 Runway 上用。直接复制粘贴通常效果不好,因为两个工具的解析逻辑不一样。

迁移的时候要注意几点:第一,语言要换。MiniMax 用中文,Runway 用英文。第二,镜头术语要换。MiniMax 写“镜头推进”,Runway 写 “dolly in”。第三,风格词要调整。有些风格词在 A 工具上有效,在 B 工具上可能没反应。第四,长度要调整。Runway 对长提示词的解析不如 MiniMax 稳定,可能需要精简。

我的经验是,跨工具迁移提示词,不要指望一次成功。先迁移核心的主体和动作描述,镜头和风格词根据目标工具的特点重新写。生成一版看看效果,再微调。

5.4 关于 MiniMax H3 在 ComfyUI 里的显存优化

MiniMax H3 在 ComfyUI 里跑,显存占用是大家最关心的问题。除了前面说的量化版和低分辨率,还有几个技巧。

技巧一:用--lowvram启动。这个参数会让 ComfyUI 把模型分块加载,显存占用能降不少,但生成速度会慢一些。

技巧二:关掉不必要的节点。有些工作流里带了预览节点、对比节点,这些都会占显存。生成的时候可以先把它们禁用。

技巧三:用 CPU 卸载。有些节点支持把部分计算放到 CPU 上,虽然慢,但能跑起来。在节点设置里找 “CPU offload” 选项。

技巧四:分批生成。不要一次性生成太长的视频。分成几段,每段 2 秒,生成完再拼接。这样每段的显存占用都在可控范围内。

技巧五:提高显存占用率。这个听起来反直觉,但有时候显存没跑满,反而效率低。如果你显存够用,可以适当提高分辨率或帧数,让 GPU 跑满,生成速度反而更快。具体怎么调,看你的显卡型号和显存大小。

5.5 关于“导演台全能工作流”的实践

网上有人分享“MiniMax H3 导演台全能工作流”,这个工作流把文生视频、图生视频、参考生视频整合在一起,还带了镜头控制和风格预设。我用过一段时间,说说体会。

这个工作流的优点是集成度高,不用自己连节点,打开就能用。缺点是节点多,显存占用大,8GB 显存跑起来比较吃力。而且预设的风格不一定符合你的需求,还是要自己调提示词。

我的建议是,如果你刚开始玩 ComfyUI,可以先从这个工作流入门,熟悉一下视频生成的流程。等你摸清楚了每个节点的作用,再根据自己的需求搭建精简版的工作流。不要一上来就追求“全能”,先把一个场景跑通再说。

5.6 提示词写作的常见误区

最后说几个我踩过的坑,希望能帮你少走弯路。

误区一:提示词越长越好。不是。长度不等于信息密度。一堆形容词堆在一起,模型反而抓不住重点。该具体的地方具体,该简洁的地方简洁。

误区二:照搬别人的提示词。别人的提示词是在别人的工具、别人的参数下调出来的。你直接拿来用,效果可能差很远。参考可以,但一定要根据自己的情况调整。

误区三:忽略负面提示词。负面提示词对画质的影响很大,尤其是消除畸形和多余肢体。不要偷懒。

误区四:不记录不总结。每次生成的结果,不管好坏,都值得记录。好的提示词是怎么写出来的,坏的提示词问题在哪,积累多了就是你的经验库。

误区五:只用一个工具。不同工具有不同优势。MiniMax 中文好,Runway 镜头准,ComfyUI 可控性强。根据场景切换工具,效率更高。

我在实际使用中的体会是,文生视频的提示词写作,三分靠技巧,七分靠练习。你看再多教程,不动手写几十条提示词,是找不到感觉的。所以,别光看,打开工具,写起来。第一条可能很烂,第十条可能还是烂,但第三十条的时候,你会发现自己已经能稳定产出可用的视频了。这个过程中积累的手感,才是真正属于你的东西。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询