AI绘画风格控制实战:从提示词到参数调优的完整指南
2026/9/7 21:38:11 网站建设 项目流程

做AI视觉模型这一块也有一段时间了,经常有朋友拿着同样一张图来问我:“为什么我出的图一股子AI味?为什么同样一句提示词,别人能出海报,我只能出素材图?”这类问题绕来绕去,最后都落在同一个点上——风格控制。风格控制能力,基本就是AI绘画从“能出图”到“能出好图”的分水岭。

这篇文章想系统梳理一下我从提示词到参数调优的完整经验。核心围绕“风格控制”这件事,讲清楚提示词怎么组织、CFG和采样器这些参数怎么调、底模和LoRA在风格上起多大作用,以及遇到风格翻车时怎么排查。内容面向正在用Stable Diffusion、Midjourney或各类视觉API做设计的同学,也适合想把自己从“反复抽卡”里捞出来的内容创作者。看完之后,你至少能把“风格不稳定”这个问题缩小到具体环节。

1. 风格控制的底层逻辑:为什么同一个模型画风差这么多

先别急着堆提示词,得先建立一个认知:一张AI图片的风格,不是某个单一环节决定的。

扩散模型生成图片的过程,简单说就是从一个全是噪声的画面开始,根据你输入的条件逐步“去噪”,一步步把像素整理成清晰的图像。这个过程中,有两个入口会影响最终画面的风格:一个是文本条件向量,也就是提示词经过编码之后告诉模型“画什么”;另一个是采样过程,也就是模型在每一轮去噪时如何从概率分布里“挑”出更接近预期的像素。

所以风格控制从来不是单靠提示词就能解决的事。提示词决定的是“内容方向和语义偏向”,采样器、步数、CFG这些参数决定的是“生成的节奏和自由度”,而底模和LoRA从根源上决定了“模型认为什么样的图像是美的”。这三层叠加在一起,才是你最终看到的画风。

举个生活化的例子,把生成一张图类比成找设计师做方案。提示词是给设计师的需求文档,写得越清楚,方案越接近你要的方向;CFG相当于甲方对需求的坚持程度,坚持过头了,设计师会为了满足你而疯狂堆砌元素,反而把画面弄得不自然;底模和LoRA则是你选的是哪位设计师,有人擅长水墨,有人擅长写实摄影,换个人整体感觉立刻不一样。

我见过太多人在提示词里塞了上百个关键词,结果风格还是失控,原因是他们只在第一层努力,参数和模型两个入口完全没管。反过来,也有人CFG调得极高,以为越“听话”越好,结果画面浓艳到发腻。理解了这个三层结构,后面调优才不会乱。

2. 提示词层:让AI听懂你想要什么风格

2.1 提示词的四个功能层次

风格控制的第一步,是把提示词当成一个结构化的信息列表,而不是一串形容词的堆砌。我习惯把提示词拆成四块:主体描述、风格定向、细节质感、环境氛围。

主体描述是“画面里有什么”,比如“一位持剑的古风青年”。风格定向是“用什么画风来画”,比如“水墨画风格、工笔重彩、赛博朋克概念设计”,这一层直接决定风格走向。细节质感是“线条、笔触、光影是什么样的”,比如“粗粝的干笔触、软光、浅景深”。环境氛围则是“空间感、颜色基调、背景元素”,比如“留白背景、淡青色基调、薄雾”。

真正影响风格稳定性的,主要是第二层和第三层。很多人风格乱,是因为把“画风”和“质感”混在一起写,AI分不清哪个才是主导。比如你想要水墨风,却在细节里写了“高清、8k、逼真、照片级”,这两个方向本身就是冲突的,模型只能在中间找平衡,结果就是四不像。

2.2 风格关键词的选型逻辑

风格词的来源主要有几类,我整理了一张常用对照表,方便你按需取用。

风格类型关键词示例适用场景
艺术家风格Greg Rutkowski、Artgerm、Alphonse Mucha需要特定审美倾向时,但注意版权伦理问题
媒介材质oil painting、watercolor、ink wash、3D render、claymation最直接的画风切换方式
流派画风impressionism、cyberpunk、flat illustration、pixel art大方向定调
年代地域traditional Chinese painting、Ukiyo-e、Tang dynasty style历史感、地域感的强指向
镜头语言cinematic lighting、depth of field、wide angle影响画面氛围和“摄影感”

这里有一个经验:风格词不是越多越好。一次提示词里塞三四个风格方向也够乱了,控制在两个以内,一个主导、一个辅助,效果最稳定。比如“ink wash, soft brush strokes”就是“水墨+软笔触”的组合,既统一又不会打架。

还有一个容易被忽略的细节:风格词在提示词里出现的顺序和权重也会影响最终结果。模型对越靠前的词越敏感,所以“风格定向”尽量放在主体描述后、细节质感前,形成一个“画谁、什么画风、什么质感”的稳定次序。

2.3 权重语法与提示词组合的进阶用法

当一句话里的元素主次不分明时,就要用权重来“点名”。在Stable Diffusion类工具里,常见写法是(关键词:数值),数值大于1表示加强,小于1表示削弱。

举一个我实际用过的例子。想让“水墨感”成为画面中最强的风格信号,可以写(ink wash style:1.4),让“飘带细节”稍微让位,写(ribbon detail:0.9)。注意,这里的数值不是越大越好,超过1.5往往会出现明显的过饱和和伪影,画面会“糊成一团”。一般加强控制在1.2到1.4之间,削弱控制在0.7到0.95之间。

另外,不同工具对权重的语法支持不太一样。A1111/ComfyUI通常支持括号和冒号数值,Midjourney则是用--style参数或::来切分权重。如果换了工具,发现风格控制不生效,优先检查是不是语法不兼容,而不是怀疑模型变笨了。

2.4 负面提示词:反向控制风格的利器

风格控制的另一半,藏在负面提示词里。

很多人只写正面提示词,不管反面,结果生成出来的图总有些“AI味”。所谓AI味,本质上是模型默认偏好的一套“平均审美”:过度锐化、皮肤塑料感、构图模板化、透视不准确。想摆脱这些,得在负面提示词里明确告诉模型不要什么。

在不同风格目标下,负面词要跟着变化。比如你想要2D水墨,负面词里要加上photorealistic, 3D render, octane render,否则模型很容易往立体厚涂方向跑偏。你想要写实摄影,负面词里写illustration, cartoon, painting又能把画感拉回来。

我个人常驻的负面提示词里有这么几个:worst quality, low quality, bad anatomy, extra fingers, blurry, overexposed, oversmoothed。遇到风格不对时再加一层针对性的负面词,调整速度和成功率都会明显提升。

3. 参数层:从CFG、采样器到随机种子的调优方案

3.1 三个最影响风格的参数

提示词决定了方向,参数决定了这个过程到底会怎么发生。我平时固定监控三个参数:CFG、采样步数、采样器。

先讲CFG,也就是无分类器引导强度。它的作用是控制生成结果对提示词的服从程度。CFG越低,模型越自由,画面可能更柔和、更有艺术感,但和提示词的相关性变弱;CFG越高,模型越努力贴合提示词,但高到一定程度就会产生所谓的“过引导”,画面变得过曝、锐化过度,像是涂了一层厚油漆。我的经验是,写实类风格用7到8,风格化内容用5到6,实验性艺术可以低到4。超过10基本都能闻到糊味了。

然后是采样步数。步数决定模型从噪声到清晰图需要迭代多少轮。步数太少,画面会显得潦草,细节没发育完全;步数太多,并不会带来更多细节,反而增加计算时间甚至让画面发糊。我常用的是25到30步,没有特殊情况不升到40步以上。

最后是采样器,这个参数对风格的影响往往被人低估。可以理解为不同的采样器就有不同的“下笔方式”。DPM++ 2M Karras是我平时的主力,通用性高,写实和动漫都能用;Euler a生成速度较快,笔触偏柔和,风格化重绘时常用;DPM++ 2M SDE线条控制更稳,遇到复杂构图时可以试。同样是写实照片风格,换了采样器出来的皮肤质感和边缘锐度会有肉眼可见的差异。

3.2 常见风格的目标参数参考表

直接给一份我经过大量对比后沉淀下来的参数组合,适合当作起步模板。

目标风格采样步数CFG采样器提示词风格方向
写实摄影28-307-8DPM++ 2M Karrasphotographic, natural lighting
水墨插画25-285-6Euler a / DPM++ 2M SDEink wash, brush strokes, oriental
3D角色三视图30-356-7DPM++ 2M SDEcharacter sheet, turnaround, clean background
赛博朋克概念28-306.5-7.5DPM++ 2M ++ Karrascyberpunk, concept art, cinematic
低多边形25-306-8Euler alow poly, geometric, clean edges

这里说一个踩坑心得:不要直接套用别人分享的参数组合。参数和提示词、底模三者是耦合的,同样一组CFG和采样器,换一个底模效果就完全变了。参考表可以当起点,但一定要有自己的变量控制意识。

3.3 随机种子与Seed锁定

随机种子是最简单又最实用的风格控制工具。同一条提示词、同一个种子,在参数不变的情况下会生成完全一样的图。这意味着你可以把种子当作“风格实验的对照组”。

我的习惯是,找到一个接近目标风格的种子后,立刻锁住,然后只改一个参数来回跑,比如只把CFG从6调到7,看看风格张力变化;或者只换采样器,观察笔触变化。每次只动一个变量,才能准确判断出哪个参数在起作用。新手最容易犯的错就是同时改提示词、CFG、采样器和种子,结果图变了却完全不知道是哪一步导致的,等于盲调。

3.4 宽高比和高清修复的连带影响

很多人调了半天参数没效果,其实问题出在图片尺寸上。宽高比会影响模型对画面的构图预期,竖构图更容易出中近景人物,横构图更容易出环境场面。人物三视图这类需要横向排布的内容,用3:2或4:3的比例比1:1更合适。

高清修复则要注意“二次风格化”的风险。开启高清修复后,模型会在放大过程中重新画一遍部分细节,如果重绘幅度设置偏高,原本确认好的风格会被“洗掉”。建议重绘幅度控制在0.3到0.5之间,或者在最终确认风格之后再统一做超分放大,而不是一边生成一边放大。

4. 进阶:模型选型与LoRA带来的硬控制

4.1 底模才是最大的风格变量

当你把提示词和参数都调顺了,仍然发现风格达不到预期,那大概率是底模的问题。

底模(Checkpoint)决定了模型整体对“美”和“真实”的基准认知。选错了底模,其他都是做无用功。想画真人质感的用写实类底模,想画日系动漫用动漫类底模,想画厚涂原画用二次元风格底模,这已经是社区共识了。挑底模时可以多看成图的皮肤质感、五官风格、背景材质这三点,这三个方面是否符合需求,决定了这个底模适不适合你。

说实话,我曾见过有人用水墨LoRA配上3D写实底模,结果出来的图永远是厚涂感。这不是LoRA失效,是底模的风格先验太强,LoRA那点权重根本拉不过底模的主场优势。

4.2 LoRA是轻量级的“风格锁”

LoRA可以理解为给大模型加的一个可插拔的小模块,专门锁定某一种具体风格。比如固定的角色风格、水墨仙侠风、某位画师的笔触风格,都能通过LoRA来强化。

LoRA的权重值是个需要细调的参数,一般落在0.6到0.9之间。权重太低,风格存在感很弱,画面偏回底模默认风格;权重过高,会出现明显的塑料感、纹理重复甚至画面变形。我调LoRA的经验是:先固定权重0.8跑第一版,如果风格感不够再加到0.9,如果出现线条毛糙或皮肤过假就降到0.7,每档变动之间用固定种子对比,很快就知道这个LoRA的合适区间。

4.3 ControlNet对构图的硬约束

风格控制还有一个容易忽略的维度:构图。提示词很难精确控制人物的姿势、角度和空间关系,AI经常画出“头在画面左边、身体却朝右边”的诡异构图。这时用ControlNet最有效。

比如做人物三视图,用ControlNet的OpenPose预处理器先确定人物的动作姿态,再用Canny或Lineart提取线稿约束结构,然后在这个结构上去做风格化,出图的稳定性提升非常明显。对我而言,想要精确控制风格里的“骨架”,光靠提示词是不够的,ControlNet这类工具是必经之路。

4.4 API接入时的参数可控性差异

现在不少人尝试把视觉模型能力接入自己的应用或工作流,比如通过API来调用模型。但API版本和本地ComfyUI/A1111相比,有一个明显的差别:可暴露的参数往往只限于数量、尺寸、temperature等基础项,很多底层采样器、CFG、负向提示词细节,并没有全部开放。

这也解释了为什么同样的提示词,在本地界面里能出很精准的风格,换成API返回结果就变了个味道。如果你以风格控制为核心的视觉应用,建议优先评估API能暴露多少生成参数;如果只暴露基础参数,就要在提示词里做更多功课,把所有风格信息尽可能压进语义层,否则想复现本地那种精细控制是很难的。

5. 实操复盘:从提示词到成图的一次完整调优记录

5.1 场景设定:AI漫剧仙侠人物三视图

把前面这些内容串起来,用我最近为一个AI漫剧项目做“仙侠水墨风人物三视图”的过程来完整走一遍。

需求很明确:一个青年男性仙侠角色,要出水墨风格的人物设定三视图,包含正面、侧面、背面,角色服装和配饰保持一致,整体要有笔墨韵味,不能像普通动漫图那样过于光滑。

第一版提示词我大约这样写:

(masterpiece:1.2), best quality, a young male cultivator, full body character sheet, three views, front view, side view, back view, traditional Chinese ink painting style, flowing robes, holding a sword, long hair, simple background, (ink wash effect:1.3), soft brush strokes

负面提示词:

worst quality, low quality, bad anatomy, extra fingers, blurry, overexposed, photorealistic, 3D render

参数选了CFG 7、步数28、Euler a、1024x768。出来的结果乍一看还行,但细看有不少问题。

5.2 第一版问题分析

第一版最大的问题有三个。第一,所谓“three views”被模型理解成了“三个不同姿势”,人物姿态和角度根本对不上,生成的是三个人而不是一个人。第二,水墨感很弱,因为我在提示词里同时写了ink wash和soft brush strokes,但CFG设到了7,模型为了“贴合提示词”把边缘画得很实,笔墨的晕染感完全出不来。第三,服装细节不一致,正面和背面的飘带位置、长短都对不上。

这个结果其实很典型:提示词方向是对的,但权重结构、参数和辅助工具都没跟上。当时我意识到,这种多视图角色设定图,靠纯提示词硬碰,效率太低。

5.3 第二轮调整方案

第二版我做了几件事。

先把提示词里的主体和结构描述拆开。主体保留角色设定,但把“three views”改成更明确的character turnaround, same character, consistent design, multiple views,让模型理解这是同一个角色的多个角度展示。水墨感则单独加了权重。同时,我把CFG从7降到5.5,采样器改成DPM++ 2M SDE,步数提到30。

接着引入ControlNet,我用了OpenPose把三视图的人物姿态定出来,确保三个角度的人物骨架基本对应。这一步之后,结构问题彻底解决了。

最后给模型加了一个水墨风LoRA,权重先设0.8。这一步是风格的关键,只靠提示词很难把厚涂底模完全掰向水墨,LoRA的介入让墨色在边缘处的晕染感出来了。

5.4 最终方案与效果

最终固定下来的提示词简化如下:

(masterpiece:1.2), best quality, a young male cultivator, character turnaround, same character, consistent outfit and hair, three views from front, side and back, traditional Chinese ink painting, (ink wash effect:1.4), wet brush strokes, flowing robe, holding a sword, simple empty background

参数表:

参数项设定值
采样步数30
CFG5.5
采样器DPM++ 2M SDE
LoRA权重0.8(水墨风格LoRA)
图片比例3:2
ControlNetOpenPose
Seed固定用于迭代

这一版出来之后,水墨感、人物一致性、三视图对应关系都达到了可用状态。整个过程提醒了我一件事:风格控制不是一句提示词的事,而是语义层、参数层、模型层的协同结果。遇到风格不对,先判断是哪一层出了问题,再针对性地调整,效率会高很多。

6. 常见问题与排查技巧实录

6.1 风格太淡或太浓

风格太淡,最常见的原因是风格词权重不够,或者底模默认风格太强。先给风格词加权重,比如从1.2提到1.4;如果还是淡,说明需要上LoRA或换底模,而不是继续死磕提示词。

风格太浓则相反,会把画面弄得像过度滤镜一样。降低CFG、降低风格词权重、或者给负面提示词加上overfiltered, oversaturated,三选一或组合使用,都能有效把画面拉回来。

6.2 AI味太重怎么破

AI味的来源通常是过度平滑的皮肤、生硬的边缘、莫名其妙的超锐化和透视错误。我建议从这几处排查:CFG是不是超过了8;步数是不是堆到了40以上;负面提示词里没有加oversmoothed, plastic skin, overexposed

还有一个容易被忽略的原因,就是底模本身更偏“大众审美平均值”。遇到这种情况,除了常规调参,换一个有个人审美倾向的底模或加上一个画风LoRA,是最直接的解法。

6.3 三视图人物不一致

三视图和multi-view设定图,本身就是AI视觉模型的弱项。除了前面提到的提示词策略和ControlNet,还有一个技巧是用固定种子配合图生图:先生成一张正面图,锁定风格,再以这张图为参考生成侧面和背面,不透明度设置在0.4到0.6之间,一致性会好很多。如果工具支持IPAdapter,用它来保持角色特征一致性,基本可以把手动返工的时间省掉一大半。

6.4 参数改了没反应

参数改了没反应,大概率是变量没控制好。排查顺序可以从这几点切入:查看种子是否被随机重置了;确认当前界面确实加载了你调整的采样器而不是缓存旧值;以及判断CFG的变化区间是否足够明显,比如从6调到6.2几乎看不出差别,从6跳到7才可能觉察到变化。

还有一个很容易踩的坑,就是你觉得自己“改了参数”,但在某些WebUI或应用里,高清修复的二次生成阶段会使用另一套参数,改了主生成参数,放大阶段又按默认配置跑了一遍,结果自然没变化。这种情况记得把高清修复参数一起检查。

6.5 我的一个调参习惯

最后再分享一个我个人的小习惯。每次做风格调优,我都先固定三个变量:底模、种子、采样器。在这个基础上去调CFG和提示词,记录每一次的输出编号和对应参数。坚持一段时间之后,你会慢慢形成一种直觉,看到一张图就能大致判断出它的风格问题出在提示词还是CFG还是LoRA权重。这种手感没法从教程里复制,但一次只动一个变量,不断横向对比,是形成这种手感最快的方式。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询