今天展示的案例是一个基于GLIGEN 文本框的 ComfyUI 工作流。通过在画布上添加文本框并设定位置,可以在生成图像时对物体的出现位置进行精确控制。与常规的文本提示词生成方式相比,这种方法为场景布局提供了更高的可控性。
例如在生成风景图片时,可以指定山脉在背景中央、太阳位于画面一角,而瓶子等细节元素则被固定在指定区域。结合 GLIGEN 的控制能力,整个流程能够在保持画面风格一致的同时,确保物体出现在理想的构图位置。
文章目录
- 工作流介绍
- 核心模型
- Node节点
- 工作流程
- 大模型应用
- CLIPTextEncode(正向) 图像生成文本条件核心
- GLIGENLoader GLIGEN 文本框模型加载器
- GLIGENTextBoxApply(多次调用) 物体位置精确控制
- EmptyLatentImage 初始潜变量生成
- KSampler 图像采样生成
- VAEDecode 最终图像解码
- 使用方法
- 应用场景
- 开发与应用
工作流介绍
该工作流以Stable Diffusion v1.5模型为基础,并结合GLIGEN 文本框模型来实现图像局部元素的精准控制。整体设计包含三个核心环节:基础模型加载、GLIGEN 条件约束以及采样与解码生成。Checkpoint 模型提供图像生成的整体语义能力,GLIGEN 模块负责解析文本框及位置信息,从而将提示中的特定元素绑定到画布指定区域。通过这种组合方式,既能发挥稳定扩散模型的绘画能力,也能满足场景构图的个性化需求。
核心模型
在该工作流中,核心模型由通用的Stable Diffusion v1.5 检查点模型与GLIGEN 文本框模型共同组成。前者负责图像的整体生成能力,确保生成结果具备高质量的细节与风格一致性;后者则承担元素位置约束的任务,允许用户在图像生成过程中设定关键物体的具体位置与尺寸。两者结合,使得生成过程既具备创造性又具备可控性,满足对构图严格要求的任务。
| 模型名称 | 说明 |
|---|---|
| v1-5-pruned-emaonly-fp16.safetensors |