说句实在话,现在玩AI绘画,最让人上火的不是画不出来,而是画出来的和你脑子里想的完全是两回事。我见过太多人憋了一晚上,最后只等来一张构图歪、手指崩、风格跑偏的图,然后骂一句“AI就这水平”就关掉了页面。其实问题根本不在AI,而在流程——你只用了“文生图”一个按钮,但真正想把“一句话描述”变成“专业级画作”,需要的是一整条流水线:文生图负责从零到一,图生图负责风格统一,局部重绘负责精修细节,智能扩图负责调整画幅。这四件事单独拎出来都是个工具,串起来才是一套完整的工作流。
这篇文章就是要把这条流水线掰开揉碎讲清楚。我会从原理讲到参数,从工具选型讲到实际操演,顺便把我踩过的坑和常用的排查方法一并整理出来。无论你是刚开始接触AI绘画的新手,还是已经在Stable Diffusion、ComfyUI、Z-Image-Turbo这些工具里折腾过一阵的进阶玩家,这篇内容都能帮你把出图质量从“能看”拉到“能发”。
1. 先搞明白:这四件事分别解决什么问题
很多人把文生图、图生图、局部重绘、智能扩图当成四个并列的功能,其实它们是四个“加工阶段”,对应的是从想法到成品的四个不同环节。搞清楚这个,后面的一切操作才有依据。
1.1 文生图:从零到一,一句话起稿
文生图是所有AI绘画的基础。它的工作原理说起来很简单:你输入一段文字描述,模型根据海量训练数据里的图文对应关系,生成一张和描述匹配的图片。但实际用起来,你会发现它最大的特点不是“听话”,而是“随机”。同样的提示词,换个种子数(seed),出来的构图、光影、动作可以完全不同。
所以文生图的正确用法,不是“一次到位”,而是“快速起稿,多批次抽卡”。你把想要的主体、场景、风格、镜头语言写清楚,跑上几张十几张,在里面挑出最接近脑补画面的那张作为底图。这个阶段的核心目标是拿到一张构图可用、关系合理的“毛坯图”,而不是一张成品。
我在实际工作中,文生图用得最多的是头脑风暴期。比如客户只说了一句“赛博朋克风格的深夜便利店”,我直接生成二十张不同视角的街景,把氛围感找出来再谈细节。这个阶段不需要精修,追求的是灵感密度和构图多样性。
1.2 图生图:从草稿到成品,让模型照着改
图生图解决的是“毛坯图不够好”的问题。它的原理是把一张现有图片作为输入,模型在保留原图结构的基础上,根据新的提示词重新绘制。关键参数叫“重绘幅度”(denoising strength),这个值决定了模型到底多大程度地“尊重”原图。
- 重绘幅度 0.2~0.4:基本只对画面做微调,光影、颜色、细节稍有变化,构图不变。
- 重绘幅度 0.5~0.7:风格会明显变化,比如从写实变插画、从白天变夜晚,但主体轮廓还能认出来。
- 重绘幅度 0.8 以上:基本等于重新画,原图只剩个构图框架。
你可以把图生图理解成“局部整容”和“整体换风格”之间的一个滑块。想要哪边多一点,就自己调。我第一次接触这个参数的时候完全没概念,直接把数值拉到0.7跑写实人像,结果人脸变了三次,每次都不是同一个人。后来才明白:面部精修要低,风格迁移才需要高。
1.3 局部重绘:精修细节,只改该改的地方
局部重绘(Inpainting)是四个功能里最“省钱”的。因为它只在你指定的区域内重新生成内容,其他部分原样保留。这个功能在手、脸、发丝、服装细节修复上至关重要——AI画手翻车是家常便饭,手指头痛是最常见的烦恼,要是每次都用整张图重绘来修复,效率极低且会破坏其他好区域。
局部重绘的底层逻辑是:你蒙上一块区域,然后告诉模型“这里我不管了,你按我的提示词重新画”。模型会参考周围像素的风格、光影和纹理来填充这块区域,所以关键在于两个点:蒙版范围要合适,提示词要明确。蒙版太大容易乱改,蒙版太小接缝明显。
我自己用得最多的场景是“换装”和“修手”。比如给一个角色换衣服,我把衣服区域蒙上,提示词写“黑色皮质夹克”,其他什么都不动,整张图依然自然流畅。这个过程比重新文生图再改构图快得多。
1.4 智能扩图:推开取景框,拓展画面边界
智能扩图(Outpainting)解决的问题是“画幅不够用”。它把原始图片作为中心内容,在周围自动补齐与风格、透视匹配的背景。举个例子:你生成了一张不错的竖构图人像,但海报需要横版的,或者视频封面需要更宽的视野,这时候直接拉伸图片会糊,直接重画又会破坏人物——扩图就是唯一正解。
扩图的底层原理是扩散模型的外推能力。模型根据已知区域的边缘信息,推测出更远处的场景轮廓、光影方向和纹理延展,然后逐块生成。难点在于“一致性”:天空的颜色、墙壁的纹理、地面的透视,都要和原图无缝衔接。一次扩太大容易“发挥过头”,让画面看起来奇怪,所以我通常按方向分多次扩,每次扩一小块再检查融接效果。
1.5 四件事组合起来,才叫真正的工作流
打个比方,文生图是“打地基”,图生图是“砌墙”,局部重绘是“贴瓷砖”,智能扩图是“把窗户开大”。单独用任何一步,房子都盖不完;把它们串起来,才算走完了一条完整的装修工序。
举一个最常见的例子。用户说:“雨夜的霓虹街角,一个穿红色雨衣的女孩撑着透明伞回头看镜头,电影感,浅景深。”
完整流程是这样的:
- 用文生图跑十几张街角场景,挑出构图最好的“毛坯图”。
- 用图生图,把重绘幅度调到0.45,提示词补充“冷色调路灯,地面反光细节”,统一整张图的风格和光影层级。
- 用局部重绘修复女孩的手,蒙版框住手部,写“自然握伞柄的姿势,五根手指清晰”;如果脸歪了,同样蒙住脸单独重绘。
- 原图是竖构图,但发布封面需要横版,用智能扩图左右各扩展一点,再检查接缝光影是否自然。
这四步走完,才是这张图的终稿。单独只用文生图,最多只能得到60分的结果;串完整条流水线,才有机会达到85分以上。这就是“一站式搞定”的真正含义。
2. 工具选型:用什么工具最省心
工具选型这块,我没少交学费。前前后后用过不下十个平台和框架,从在线网页版到本地部署,从开源大模型到商业收费API,最后沉淀下来的一套组合拳,我下面直接讲结论。
2.1 ComfyUI 为什么是工作流首选
如果你要把文生图、图生图、局部重绘、智能扩图这四个操作串成一个流程,本地部署的ComfyUI是我目前用过最顺手的工具。它的核心优势在于“节点式工作流”——每一个操作步骤都是一个节点,你可以把整条加工线固定下来,下次直接拖一张图进来、改一个提示词就能跑,不需要每次重复设置。
ComfyUI的另一大优势是可控性。你可以在一个工作流里同时跑文生图和图生图,可以集成ControlNet控制姿态和深度,可以加载各种大模型和加速模型。比如用Z-Image-Turbo这类蒸馏过的快速模型,配合低步数设置,单张图出图速度肉眼可见地提升,这在多轮抽卡阶段特别有价值。
当然,ComfyUI不是没有门槛。它的界面乍一看像一堆面条(节点连线),新手很容易蒙圈。我的建议是:先用网页版工具跑明白四个操作流程,再迁移到ComfyUI里搭固定工作流,一步到位反而容易劝退。
2.2 在线工具与免费生图API怎么选
不是所有人都有条件本地跑大模型,显卡不够、显存爆掉,都是现实问题。这时候在线平台和免费生图API就是很好的过渡方案。像豆包AI、GPTImage2这类工具,都提供了直接的文生图入口,界面图方便,还带多少不等的免费额度。
我的建议是“先用在线把流程跑通,再考虑自建”。流程是哪几步、参数怎么调、提示词怎么组织,这些经验在任何工具上都适用。而且现在不少在线API都提供足够的调用额度,写个脚本批量生成完全够用。关于成本问题,有人会纠结“GPTImage2生一张2K图多少钱”,其实高分辨率生成一般按像素和步数计费,2K图(2560×1440)的消耗通常远高于1024×1024的图,但如果你先用低分辨率出草稿、再用放大模型翻倍,每张图的成本能降不少。
另外要提醒一句:在线平台生成的图片,很多会自动附带平台水印或元数据。如果你要用于正式作品集或商用项目,最好在生成时就选择支持导出原图的模型,或者自己本地搭建ComfyUI出图,从头到尾不过任何平台,水印问题自然就不存在。个别去找所谓“无水印插件”,反而容易绕进各种不稳定甚至违规的工具,没必要冒这个风险。
2.3 模型和采样器怎么搭配
选好工具之后,最影响出图质量的是“模型”和“采样器”。不同模型擅长不同画风:写实风格的模型(如RealVisXL系列)适合人像、建筑、产品图;二次元模型(如Illustrious、NoobAI系谱)则对动漫角色、日系背景的还原度更高;通用大模型(SDXL底模)则各方面均衡,适合新手。而Z-Image-Turbo这类Turbo模型,靠蒸馏技术把推理步数大幅压缩,几秒就能出一张质量不错的图,适合需要大量抽卡的场景。
采样器这块,我用得比较多的是Euler a和DPM++ 2M Karras。简单说,采样器就是“决定每次去噪怎么走”的算法。Euler a速度偏快、风格偏细腻,比较适合写实;DPM++ 2M Karras则细节保留好、颜色更实,适合风格化程度高的图。步数上,普通SDXL建议25到30步,Turbo模型8到12步就够,再高意义不大还会拖慢速度。上面这些参数不是死规矩,但作为起点非常可靠。
2.4 分辨率、显存与出图效率的权衡
分辨率这块最好理解也最容易踩坑。很多人一上来就选2K、4K,结果显存爆了,或者图出来虽然大,构图却空荡荡。我的实操经验是:先以1024×1024或1024×1536出图,构图满意后再做高清放大。直接一步到位生成高分辨率大图,不仅吃显存,模型细节也不如在低分辨率下精细控制得好。
如果你的显卡显存不到8G,可以先把分辨率降到768×768,出了构图再用重绘幅度0.3左右的图生图放大;或者借助在线API分担压力。ComfyUI里把“低分辨率出图+潜空间放大”串成固定节点,平时批量出图效率很高。别被“大图才专业”误导,构图崩掉的大图,远不如构图完整的小图有价值。
3. 完整实操流程:从一句话描述到专业级画作
光讲概念不落地等于白说。下面我用一个具体案例,带你走一遍从“一句话描述”到“专业级画作”的全流程实操。案例我就用前面提到的“雨夜红雨衣女孩”来走,这套方法你可以直接套用到任何题材。
3.1 第一步:把一句话拆成结构化提示词
大多数人文生图失败,根本问题不是写得不够多,而是写得太乱。模型理解长句子的能力有限,它更擅长理解“要素清单”。所以第一件事,把一句话拆成六个维度的词块:
- 主体:红雨衣女孩,撑着透明伞,回头看镜头
- 动作/姿态:回头,左手握伞柄
- 环境:雨夜,霓虹街角,地面湿润反光
- 光线:冷色调路灯,霓虹灯散射,电影感光
- 风格:写实,浅景深,居中构图
- 质量词:masterpiece,best quality,8K,sharp focus
对应提示词大概是:
A girl in a red raincoat, holding a transparent umbrella, looking back at the camera, rainy night, neon-lit street corner, wet ground with reflections, cold street lamp light, cinematic lighting, shallow depth of field, photorealistic, masterpiece, best quality, 8K, sharp focus负面提示词也不要省:
worst quality, low resolution, bad anatomy, extra fingers, deformed hands, blurry, watermark, text提示词顺序也有讲究。越靠前的内容对模型的影响权重越大,所以主体和姿态一定放最前面,风格和质量词靠后。这一点对SD系列模型尤其明显。
3.2 第二步:文生图快速起稿
打开ComfyUI,加载你要用的模型。这里我直接用Z-Image-Turbo搭一个快速工作流,步数10,CFG设为1.5左右(Turbo模型对CFG的敏感度和传统模型不一样,别照搬SDXL的7),采样器用Euler a,尺寸1024×1024,一次生成8张候选图。
这一步的目标很简单:挑图,不修图。我看到生成出的8张图里,经验是一眼扫过去先筛构图——哪张街角透视舒服,哪张人物位置居中,哪张雨夜氛围到位。选出2-3张构图满意的,然后看细节:手是不是崩了,伞是不是完整。选一张最顺眼、最值得继续打磨的作为底图,记下它的种子值,后面所有操作都以这张图为基础。
3.3 第三步:图生图统一风格和光影细节
底图拿到手,画面大概率还有不少“毛刺”:风格不够统一,局部曝光不对,反光不够自然。这时候进图生图,把底图拖进工作流,重绘幅度调到0.42左右,提示词在原有基础上增加光线氛围描述:
cinematic lighting, neon reflections on wet ground, soft glow on the raincoat, detailed background bokeh这里有个细节:图生图的“重绘幅度”不要一步拉到0.7去“大改特改”,不然前面文生图选好的构图会被搅乱。0.4左右既能保持构图,又能让模型在原基础上补细节。跑2到4个变体,选一张光影、材质最舒服的继续。
3.4 第四步:局部重绘精修细节
现在开始处理最磨人的细节部分。两步走:
修手。用局部重绘的蒙版把右手区域粗略框住(范围略大于手部),提示词写“a natural hand holding an umbrella handle, five fingers, realistic skin texture”,重绘幅度0.45。有时候一次重绘手还是崩,就多跑几个批量再选。
修脸。人物回头这个动作最容易把脸画歪,用同样的方法把头部区域单独蒙上,提示词写“detailed face, natural expression, looking back, symmetrical eyes”,重绘幅度0.35。注意蒙版不要碰到头发边缘扩大到背景,否则背景会被重绘得发糊。
局部重绘的蒙版选择要“宁大勿小”。蒙版太小,重绘区域和周围像素衔接不上,会出现明显的接缝断层;蒙版稍微扩大一点,重绘时能参考更多周围信息,融接会自然很多。但也不要大到把整个头都框进去,那等于人物大改。
3.5 第五步:智能扩图适配发布场景
精修完成,画面主体已经很能打了。但如果发布平台是横版头图,竖构图就直接废掉。这里上智能扩图。
我用ComfyUI里的扩图节点,把竖构图(1024×1536)向左右两侧各扩展512像素,让画面比例接近3:2。扩图时提示词要保持原来的环境描述,特别是“rainy neon street corner, blurred city lights, wet reflection”,让模型知道你扩展的区域还是同样的雨夜街角。
扩图不是一蹴而就。我的习惯是:先左扩,再右扩,每扩一次就审视一次融接效果,看看新补的区域和原图的光线方向是否一致。如果某一块的纹理对不上,立刻缩小扩展范围或者用局部重绘再补一遍。等构图满意了,最后再整图过一遍重绘幅度0.2的轻量图生图,把接缝感压下去。
3.6 可以抄作业的提示词模板和参数表
实战多了,我沉淀了一套通用的模板,你可以直接替换里面的内容:
[主体描述], [动作姿态], [场景环境], [光线氛围], [风格风格词], [镜头语言], [质量词]参数速查,直接收藏:注意区分阶段和数值。
| 阶段 | 方法 | 重绘幅度 | 步数 | CFG | 分辨率 |
|---|---|---|---|---|---|
| 起稿 | 文生图 | — | 10-12(Turbo)/ 25-30(SDXL) | 1.5-2(Turbo)/ 5-7(SDXL) | 1024×1024 |
| 风格统一 | 图生图 | 0.4-0.5 | 同上 | 同上 | 与底图一致 |
| 精修细节 | 局部重绘 | 0.35-0.5 | 同上 | 同上 | 与底图一致 |
| 拓展画幅 | 智能扩图 | 0.5-0.6 | 同上 | 同上 | 按目标比例 |
记住一句话:参数是起点,不是终点。每一次调整都要看你手里的实际效果,养成保存不同版本的习惯,别在一张图上死磕。
4. 常见问题排查与避坑技巧
无论流程多熟,实际跑图一定会遇到各种问题。有些问题看起来像是AI“抽风”,其实都有章可循。我下面按高发频率整理一套排查心得。
4.1 手总是画崩,怎么修都不干净
手部崩坏是AI绘画的老大难问题。根源在于模型训练素材里,手部的像素占比太小、结构变化又太复杂,模型很难学会“五根手指的拓扑关系”。局部重绘能缓解,但如果你反复修一只坏手,重绘结果依然不对,问题往往出在重绘幅度太低或者提示词太泛。
我的做法是:局部重绘时把蒙版覆盖到手腕附近,给模型更多结构上下文;提示词要具体,直接写“five fingers, natural hand pose, realistic skin”,并加负面提示词“extra fingers, missing fingers, deformed hand”。另外,重绘幅度不要低于0.4,太低会让模型在原崩坏结构上反复横跳。如果还是不行,换个种子试试,或者回到文生图阶段重抽一张手部还算完整的底图,别死磕。
4.2 图生图之后画面风格统一了,但细节全糊了
这个问题的典型原因是重绘幅度调太高。人眼的判断和模型的计算逻辑不太一样:你觉得某个细节需要“大改”,于是把幅度拉到0.7,结果模型不只改了细节,把整个画面的纹理细节都重画了一遍,导致皮肤质感、布料纹理全部糊成一团。
解决办法很简单:涉及“细节修补”的场景,重绘幅度压在0.35以下。如果你确实想让风格大幅度变化,那你就接受“换风格的同时细节会重排”这件事,后续用局部重绘再把关键细节补回来。风格和细节是两回事,不能指望一个参数同时完成两件事。
4.3 局部重绘后边缘有断层、色差明显
这是局部重绘最常出现的副作用。主要原因有两个:一是蒙版太贴着修复对象,重绘区域和周围像素的“语境信息”不够,融接不自然;二是重绘幅度太高,让重绘区域产生了一个“自带光源”。
排查顺序我建议如下:先检查蒙版是否覆盖了足够的周边区域(比如修手时把附近伞柄和雨衣边缘也带进去);然后看重绘幅度是否超过0.55,超过的话降下来;如果断层严重,就用图生图把整张图作为输入,重绘幅度0.2过一遍,相当于给全图做了一次“匀光处理”。大部分断层问题在最后一步都能压下去。
4.4 智能扩图之后,新区域和原图风格对不上
扩图区域的“自作主张”是最常见的翻车现场:原图是冷色调雨夜霓虹,扩出来的区域却多出一块暖光招牌,或者地平线歪了。核心原因是提示词没有约束住环境,模型默认“空白区域可以自由发挥”。
应对策略有两个。一是把原图的风格关键词在提示词里写得更死,不止写“neon street corner”,还要写“cool tone, wet road reflections, blurred city lights in background”。二是分多次扩图,每次只扩一小块并检查结果,不要一次性把四周全扩完。风格对不上的区域,用局部重绘把差异明显的那块蒙起来,提示词保持和环境一致,重绘幅度0.4左右救回来。
4.5 显存溢出、出图速度慢到怀疑人生
本地部署用户最现实的困扰就是硬件瓶颈。一个直接科普:不要把高分辨率当作调一次参数就完成的事。我的方案是“草稿低分辨率+精修后的智能放大”——先用768×768甚至512×768快速出草稿,把构图、光线和风格调好,最后再用放大模型(如4x-UltraSharp)放大到2K。整个过程显存占用平均但效果不输直接出大图。
如果出图实在太慢或者频繁报错,还有一个“懒人方案”:脑子里的图已经有雏形,直接用在线API把重活干掉,本地保留ComfyUI做精修和局部重绘。别和显卡较劲,工具是为人服务的,写完一句提示词等五分钟,那是服务器热到冒烟了,不是你的问题。
4.6 常见问题速查表
最后整理一个排查速查表,平时遇到问题直接对着查:
| 症状 | 可能原因 | 解决方案 |
|---|---|---|
| 手崩/手指数量不对 | 模型对手部结构理解弱 | 局部重绘蒙版覆盖手腕,提示词强调“five fingers”,增加负面词 |
| 图生图后细节糊 | 重绘幅度过高 | 压到0.35以下,或用0.2的全图轻走一遍 |
| 局部重绘边缘断层 | 蒙版太紧/幅度太高 | 扩大蒙版范围,降低重绘幅度,整图轻图生图匀光 |
| 扩图风格对不上 | 提示词约束不足/扩展过大 | 写死环境风格词,分多次小步扩展 |
| 显存溢出 | 直接生成高分辨率大图 | 先小图出草稿最后再放大 |
| 出图总是一张不如一张 | seed随机波动 | 选好底图后固定seed,微调用重绘幅度而非重新抽卡 |
个人实战体会
这套流程我用了大半年,最大的感受是:AI绘画拼的不是某个按钮按得好,而是从模糊想法到最终成品的一整条加工线的完整度。以前我拿到一个需求就直接文生图,十次里九次要推倒重来;现在我先写结构化提示词,再走图生图、局部重绘、智能扩图的完整流程,一张图从初稿到定稿的通过率高出太多了。
最后分享一个小习惯:每次开工前,我会在一张空白文档里先写出这次的核心提示词、种子号、模型名、关键参数,出了图就记一行结果。看起来麻烦,但当你回头看自己的迭代记录,会发现踩过的坑和调顺的参数都能复用。AI绘画和传统绘画最大的区别是它允许你低成本试错,但如果连试错记录都不留,那每次都是从头再来。