Stability AI generative-models 完整指南:从环境搭建到跑通首个视频生成
2026/9/4 12:47:04 网站建设 项目流程

Stability AI generative-models 完整指南:从环境搭建到跑通首个视频生成

【免费下载链接】generative-modelsGenerative Models by Stability AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-models

generative-models 是什么,能帮你做什么

generative-models 是 Stability AI 生成模型的官方开源仓库,代码以sgm包发布(当前版本 0.1.0,要求 Python ≥3.8)。它覆盖从文本生成图像(SDXL)、图像生成视频(SVD、SV3D)到视频生成 4D 内容(SV4D 2.0)的完整链路,权重统一放在 Hugging Face 的 stabilityai 组织下。

代码库采用配置驱动的方式:模型由configs/下的 YAML 通过instantiate_from_config()组装,采样器、引导器与网络解耦,改采样步数或引导强度只需动配置文件。日常使用有两个入口,scripts/sampling/下的命令行脚本和scripts/demo/下的 streamlit 页面。

各模型的输入输出规格如下,均来自 README 的官方说明:

模型输入输出分辨率
SDXL base 1.0文本提示词图像1024×1024
SVD单张图像14 帧视频576×1024
SVD-XT单张图像25 帧视频576×1024
SV3D单张图像21 帧环绕视频576×576
SV4D5 帧视频40 帧(5 帧 × 8 视角)576×576
SV4D 2.012 帧视频48 帧(12 帧 × 4 视角)576×576

开始之前:3 分钟确认环境

动手前确认三件事,避免装到一半返工:

  1. Python 版本:README 明确环境在python3.10下测试过,其他版本可能出现依赖冲突。先确认本机有 python3.10。
  2. GPU 与 CUDA:推理脚本默认使用cuda设备,torch 需要按你的 CUDA 版本安装(README 示例用的是 cu118 索引源)。
  3. 权重可下载:模型权重托管在 Hugging Face,需下载后放入仓库的checkpoints/目录;部分模型(如 SDXL 0.9 系列)需先申请权限,提前确认账号可访问。

完整操作流程

如何搭建 python3.10 虚拟环境并安装 sgm 依赖

先克隆仓库并进入目录,之后所有命令都以仓库根目录为工作目录:

git clone https://gitcode.com/GitHub_Trending/ge/generative-models cd generative-models

成功的标志是ls能看到sgm/configs/scripts/这几个目录。

接着创建虚拟环境并依次安装:先装对应 CUDA 的 torch,再装requirements/pt2.txt里的其余依赖,最后pip3 install .安装仓库自带的 sgm 包:

python3.10 -m venv .pt2 source .pt2/bin/activate pip3 install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118 pip3 install -r requirements/pt2.txt pip3 install .

装完后在环境里执行import sgm不报错,就说明安装正常。如果后续要训练而不只是推理,还需要按 README 的 sdata 步骤额外安装官方数据管道包。

如何把权重放进 checkpoints 并跑通 SV4D 2.0 推理

各采样脚本的模型配置(如scripts/sampling/configs/sv4d2.yaml)把权重路径固定为checkpoints/sv4d2.safetensors,所以先按这个文件名把权重下到位:

huggingface-cli download stabilityai/sv4d2.0 sv4d2.safetensors --local-dir checkpoints

完成后checkpoints/目录里应出现sv4d2.safetensors。之后想核对完整性时,可用sha256sum计算文件哈希,与 README 公布的 File Hash 对比(例如 SDXL base 1.0 为31e35c80fc4829d14f90153f4c74cd59c90b779f6afe05a74cd6120b893f7e5b),不一致说明文件损坏,重新下载即可。

仓库自带示例输入,直接执行 QUICKSTART 命令,用内置的示例视频做条件输入:

python scripts/sampling/simple_video_sample_4d2.py --input_path assets/sv4d_videos/camel.gif --output_folder outputs

默认采样 50 步、输出分辨率 576×576。成功标志是outputs/下生成一组000000_v000.mp4命名的文件,对应 4 个新视角的视频。

如果更习惯页面交互,可以启动 streamlit 演示,它支持 SVD 与 SV3D 的采样:

streamlit run scripts/demo/video_sampling.py

浏览器打开页面、出现图像上传区即表示就绪。

常见问题与排查

现象:生成时报 CUDA out of memory。原因:encoding_tdecoding_t的默认值一次编解码多帧,脚本注释明确说这两项最吃显存。处理:加--encoding_t=1 --decoding_t=1,或用--img_size=512降低分辨率。

现象:启动时报找不到 checkpoint 或加载模型失败。原因:权重文件名或位置与 yaml 配置里的路径不一致,该路径是相对仓库根目录的。处理:按上一节重新下载,确认文件就放在checkpoints/下且文件名完全一致,不要多套一层目录。

现象:pip 安装依赖时反复出现版本冲突。原因:虚拟环境没用 python3.10 创建,而 README 只保证 3.10 下可用。处理:删掉现有环境,按前面步骤用python3.10 -m venv重建后重装。

下一步去哪

  • 想换模型:用scripts/sampling/simple_video_sample.py--version参数切换svdsv3d_u等版本,各模型的 yaml 在 scripts/sampling/configs/ 目录。
  • 想自己训练:从 configs/example_training/toy/mnist_cond.yaml 这类小数据集配置入手,用python main.py --base <config>启动;非 toy 配置里有USER:注释标记,需要按数据集修改。
  • 想理解内部实现:读 sgm/modules/diffusionmodules/,其中denoiser.pysampling.pyguiders.py分别对应仓库"去噪器、采样器、引导器解耦"的核心设计。

权重放进checkpoints/后,SVD 和 SV3D 的跑法与上面完全一致。建议先把 SV4D 2.0 这个例子跑通,再按兴趣切换模型。

【免费下载链接】generative-modelsGenerative Models by Stability AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-models

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询