kohya_ss 使用指南:用 20 张图片快速训练自己的 LoRA 模型
2026/9/13 5:29:48 网站建设 项目流程

kohya_ss 使用指南:用 20 张图片快速训练自己的 LoRA 模型

【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss

kohya_ss 是 Stable Diffusion 社区最常用的图形化微调工具,把原本要在终端敲命令的训练脚本包成了浏览器界面:LoRA、DreamBooth、全量微调都能点点鼠标完成,本地装或上云都行,适合想给模型加角色、加风格、改习惯的普通用户。

🎯 它解决什么问题

Stable Diffusion 会画画,但你不满意某个具体角色的长相、某种画风的细节,或者它总把某个元素画错。微调就是拿一批图反复教它。说白了,kohya_ss 把这套"教"的过程搬进了浏览器:你负责选图、填参数、点开始,底层要执行的命令行命令它自动生成,还能直接复制出来在终端复用。

它能教的内容分几档:

  • LoRA / LoHa / LoKR:插件式微调,只学增量知识,产物文件小、加载快,是绝大多数人的第一选择
  • DreamBooth:专门学"一个特定对象",比如你自己、某个 IP 角色,可以搭配参考图
  • 全量微调:把整个底模往你的审美方向推,吃数据也吃显存
  • Textual Inversion:只教模型认识一个新词,最轻量
  • LECO:反向操作,专门从模型里"抹掉"某个不想要的概念

支持的底模从 SD 1.5、SDXL、SD3 到 Flux.1、HunyuanImage-2.1、Lumina、Anima,基本覆盖了主流 Stable Diffusion 生态。

💻 三条安装路线,各适合谁

本地安装:uv 优先,pip 兜底

有 NVIDIA 显卡的机器直接本地装。先把仓库克隆下来:

git clone https://gitcode.com/GitHub_Trending/ko/kohya_ss

官方文档给了两条路:uv 装得快、依赖隔离干净,建议优先试它;pip 更传统,出问题好排查。Windows 用户参考 docs/Installation/uv_windows.md,Linux 和 macOS 各有对应文档。装完运行 gui.sh 或 gui.bat,浏览器自动打开界面。Python 版本被锁在 3.10,安装脚本会自动处理,不用自己纠结。

没显卡或不想折腾:上云跑

云上有现成方案:Colab 有社区维护的 notebook,免费但要抢卡;Runpod、Novita 是付费 GPU 实例,适合长期训练;Docker 适合习惯容器化的开发者。如果你的显存不到 12GB,直接上云是最省心的路线。

📁 训练集怎么摆,才不用返工

文件夹名的前缀数字决定重复次数

kohya_ss 习惯按文件夹组织训练数据,文件夹名开头的数字决定这组图被重复学习几次:

dataset/ ├── 10_my_character/ # 重复 10 次,目标图 │ ├── img01.jpg │ └── img01.txt └── 1_dog/ # 重复 1 次,通常是参考图

角色类训练的典型配法:目标图 10 倍,长得像但不是目标的参考图 1 倍。目标图建议 15~30 张,角度、姿态、光照要有变化,一张正面图学不出能换场景的角色。

每张图配一个同名 txt 说明

图旁边放一个同名的 .txt 文件写描述(caption),训练时优先用它,文件夹名靠边站。写的时候把"它是什么"和"它此刻在干什么"分开:目标本身的特征(发型、眼睛)和可变部分(衣服、背景)分开描述,模型才能学会"换装不换脸"。完整的选项和写法说明在 docs/train_README.md 里。

提示:图片不用预先缩放,训练分辨率由参数控制;但超过 3000 像素的大图最好先压一下,避免训练中出意外。

不想写 caption:用"类别+代号"偷懒

实在不想逐张写说明,可以给每组图统一一个标签(比如shs person),不用任何 txt 文件。代价是模型会把服装、背景一起学进去,换场景能力差一点。想学特定人物的话,还是 caption 方式更值得花时间。

🧩 五种训练模式:先选对,再谈调参

模式怎么选

模式适合场景数据量参考
LoRA / LoHa / LoKR加角色、加风格、加物件15~30 张起
DreamBooth学特定个人/角色,可配参考图20 张 + 参考图
全量微调改整个底模的审美倾向数百到数千张
Textual Inversion只教一个新词20~40 张

参数不用从零编

仓库的 presets/ 目录里存了一批调好的参数组合:adafactor、prodigy、SDXL 标准配置等,下拉直接选就行,省掉大半猜参数的时间。每个界面还能一键打印出本次生成的完整命令行——这套命令可以脱离 GUI 直接复用,界面不会把你锁死。

提示:SDXL 的 LoRA 训练建议显存 12GB 起步、分辨率给到 1024,并勾选只训 UNet 部分,避开 SDXL 双文本编码器带来的意外结果。

⚠️ 训练跑不动?四个高频问题

显存和内存不够

训练崩在 page file 之类的报错上,多半是系统内存不够,Windows 用户把页面文件调大即可解决。SDXL 训练吃显存,12GB 以下建议开 fp8 或缩小 batch size,仓库预设里有现成的 fp8 配置。

环境和依赖小毛病

两个高频报错:提示 no module called tkinter,是系统缺 Python 图形库,按 README 指引补装;Tesla V100 用户可能遇到显卡利用率上不去的问题,官方有专门的排障文档 docs/troubleshooting_tesla_v100.md。

训练途中看不到效果

LoRA 界面支持训练中生成样图:每隔若干步用你的提示词出一张图,学到哪一步、过没过拟合,肉眼可见。这个功能建议一直开着,不然只能训完才发现方向跑偏。

🧰 训练之外,顺手能做的小事

GUI 里还塞了一堆围绕训练的小工具,不用另找脚本:验证 LoRA 文件是否损坏、从两个模型做差反推出 LoRA、调整已有 LoRA 的 rank、用 BLIP 或 WD14 给图片批量生成描述(省掉手写 txt 的大部分工作量)。

让界面记住你的习惯

根目录有一份 config example.toml,复制后改名为 config.toml,模型路径、输出目录这些字段每次启动都会自动填好,不用反复选文件夹。界面支持中文等多语言;在远程服务器上跑时,加 --headless 参数可以只启动后端,用浏览器连上去操作。

第一次用的话,最稳的起点是:拿 15 张图、低分辨率、默认参数跑一个最小的 LoRA,确认整个流程通了,再回去调学习率和重复次数。

【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询