kohya_ss 使用指南:用 20 张图片快速训练自己的 LoRA 模型
【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss
kohya_ss 是 Stable Diffusion 社区最常用的图形化微调工具,把原本要在终端敲命令的训练脚本包成了浏览器界面:LoRA、DreamBooth、全量微调都能点点鼠标完成,本地装或上云都行,适合想给模型加角色、加风格、改习惯的普通用户。
🎯 它解决什么问题
Stable Diffusion 会画画,但你不满意某个具体角色的长相、某种画风的细节,或者它总把某个元素画错。微调就是拿一批图反复教它。说白了,kohya_ss 把这套"教"的过程搬进了浏览器:你负责选图、填参数、点开始,底层要执行的命令行命令它自动生成,还能直接复制出来在终端复用。
它能教的内容分几档:
- LoRA / LoHa / LoKR:插件式微调,只学增量知识,产物文件小、加载快,是绝大多数人的第一选择
- DreamBooth:专门学"一个特定对象",比如你自己、某个 IP 角色,可以搭配参考图
- 全量微调:把整个底模往你的审美方向推,吃数据也吃显存
- Textual Inversion:只教模型认识一个新词,最轻量
- LECO:反向操作,专门从模型里"抹掉"某个不想要的概念
支持的底模从 SD 1.5、SDXL、SD3 到 Flux.1、HunyuanImage-2.1、Lumina、Anima,基本覆盖了主流 Stable Diffusion 生态。
💻 三条安装路线,各适合谁
本地安装:uv 优先,pip 兜底
有 NVIDIA 显卡的机器直接本地装。先把仓库克隆下来:
git clone https://gitcode.com/GitHub_Trending/ko/kohya_ss官方文档给了两条路:uv 装得快、依赖隔离干净,建议优先试它;pip 更传统,出问题好排查。Windows 用户参考 docs/Installation/uv_windows.md,Linux 和 macOS 各有对应文档。装完运行 gui.sh 或 gui.bat,浏览器自动打开界面。Python 版本被锁在 3.10,安装脚本会自动处理,不用自己纠结。
没显卡或不想折腾:上云跑
云上有现成方案:Colab 有社区维护的 notebook,免费但要抢卡;Runpod、Novita 是付费 GPU 实例,适合长期训练;Docker 适合习惯容器化的开发者。如果你的显存不到 12GB,直接上云是最省心的路线。
📁 训练集怎么摆,才不用返工
文件夹名的前缀数字决定重复次数
kohya_ss 习惯按文件夹组织训练数据,文件夹名开头的数字决定这组图被重复学习几次:
dataset/ ├── 10_my_character/ # 重复 10 次,目标图 │ ├── img01.jpg │ └── img01.txt └── 1_dog/ # 重复 1 次,通常是参考图角色类训练的典型配法:目标图 10 倍,长得像但不是目标的参考图 1 倍。目标图建议 15~30 张,角度、姿态、光照要有变化,一张正面图学不出能换场景的角色。
每张图配一个同名 txt 说明
图旁边放一个同名的 .txt 文件写描述(caption),训练时优先用它,文件夹名靠边站。写的时候把"它是什么"和"它此刻在干什么"分开:目标本身的特征(发型、眼睛)和可变部分(衣服、背景)分开描述,模型才能学会"换装不换脸"。完整的选项和写法说明在 docs/train_README.md 里。
提示:图片不用预先缩放,训练分辨率由参数控制;但超过 3000 像素的大图最好先压一下,避免训练中出意外。
不想写 caption:用"类别+代号"偷懒
实在不想逐张写说明,可以给每组图统一一个标签(比如shs person),不用任何 txt 文件。代价是模型会把服装、背景一起学进去,换场景能力差一点。想学特定人物的话,还是 caption 方式更值得花时间。
🧩 五种训练模式:先选对,再谈调参
模式怎么选
| 模式 | 适合场景 | 数据量参考 |
|---|---|---|
| LoRA / LoHa / LoKR | 加角色、加风格、加物件 | 15~30 张起 |
| DreamBooth | 学特定个人/角色,可配参考图 | 20 张 + 参考图 |
| 全量微调 | 改整个底模的审美倾向 | 数百到数千张 |
| Textual Inversion | 只教一个新词 | 20~40 张 |
参数不用从零编
仓库的 presets/ 目录里存了一批调好的参数组合:adafactor、prodigy、SDXL 标准配置等,下拉直接选就行,省掉大半猜参数的时间。每个界面还能一键打印出本次生成的完整命令行——这套命令可以脱离 GUI 直接复用,界面不会把你锁死。
提示:SDXL 的 LoRA 训练建议显存 12GB 起步、分辨率给到 1024,并勾选只训 UNet 部分,避开 SDXL 双文本编码器带来的意外结果。
⚠️ 训练跑不动?四个高频问题
显存和内存不够
训练崩在 page file 之类的报错上,多半是系统内存不够,Windows 用户把页面文件调大即可解决。SDXL 训练吃显存,12GB 以下建议开 fp8 或缩小 batch size,仓库预设里有现成的 fp8 配置。
环境和依赖小毛病
两个高频报错:提示 no module called tkinter,是系统缺 Python 图形库,按 README 指引补装;Tesla V100 用户可能遇到显卡利用率上不去的问题,官方有专门的排障文档 docs/troubleshooting_tesla_v100.md。
训练途中看不到效果
LoRA 界面支持训练中生成样图:每隔若干步用你的提示词出一张图,学到哪一步、过没过拟合,肉眼可见。这个功能建议一直开着,不然只能训完才发现方向跑偏。
🧰 训练之外,顺手能做的小事
GUI 里还塞了一堆围绕训练的小工具,不用另找脚本:验证 LoRA 文件是否损坏、从两个模型做差反推出 LoRA、调整已有 LoRA 的 rank、用 BLIP 或 WD14 给图片批量生成描述(省掉手写 txt 的大部分工作量)。
让界面记住你的习惯
根目录有一份 config example.toml,复制后改名为 config.toml,模型路径、输出目录这些字段每次启动都会自动填好,不用反复选文件夹。界面支持中文等多语言;在远程服务器上跑时,加 --headless 参数可以只启动后端,用浏览器连上去操作。
第一次用的话,最稳的起点是:拿 15 张图、低分辨率、默认参数跑一个最小的 LoRA,确认整个流程通了,再回去调学习率和重复次数。
【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考