如何上手 LTX-Video:实时视频生成模型的安装与使用指南
【免费下载链接】LTX-VideoOfficial repository for LTX-Video项目地址: https://gitcode.com/GitHub_Trending/ltx/LTX-Video
LTX-Video 是 Lightricks 开源的基于 DiT(Diffusion Transformer)架构的视频生成模型,官方定位为"实时视频潜扩散模型",支持文本生成视频、图像生成视频、多关键帧条件控制、视频前后向延长以及视频到视频转换等能力,且这些功能可以在同一个模型中自由组合。模型默认输出 1216×704 分辨率、30 FPS 的视频,蒸馏(distilled)版本在 H100 上可做到实时生成。需要注意:官方已将后续开发重心迁移到 LTX-2(支持音频+视频同步生成),本仓库对应的是 LTXV 0.9.x 系列模型,仍可用于推理和作为二次开发的基座。
效果展示
以下是仓库README.md中展示的三类生成效果,分别对应文生视频、图生视频和受控视频(IC-LoRA):
环境要求与安装
官方说明的测试环境为:Python 3.10.5、CUDA 12.2、PyTorch ≥ 2.1.2;macOS 上 MPS 后端在 PyTorch 2.3.0 下测试通过(支持 PyTorch 2.3 或 ≥ 2.6)。核心依赖包括torch>=2.1.0、diffusers>=0.28.2、transformers>=4.47.2,<4.52.0、huggingface-hub~=0.30、einops、timm等(见 pyproject.toml)。
git clone https://gitcode.com/GitHub_Trending/ltx/LTX-Video cd LTX-Video python -m venv env && source env/bin/activate python -m pip install -e .[inference]模型权重(如ltxv-13b-0.9.8-distilled.safetensors)由inference.py在首次运行时通过 Hugging Face Hub 自动下载到本地,无需手动获取。若要在 Ada(RTX 40 系)及更新架构的显卡上启用 FP8 量化推理,还需额外安装官方的 Q8 Kernels(FP8 权重依赖该推理加速组件)。
快速上手:生成第一个视频
安装完成后,直接运行仓库根目录的 inference.py 即可。以蒸馏版 13B 模型为例执行文本生成视频:
python inference.py --prompt "A cat walking on the street, cinematic" --height 704 --width 1216 --num_frames 121 --seed 42 --pipeline_config configs/ltxv-13b-0.9.8-distilled.yaml参数说明(均为InferenceConfig默认值,见 ltx_video/inference.py):
--height 704 --width 1216 --num_frames 121:即约 4 秒的 720p 级视频,是默认规格;--seed:固定随机种子,用于复现同一构图与风格;--pipeline_config:指定 configs/ 下的管线配置,决定用哪个权重、什么精度、走多尺度管线还是单管线;- 输出自动保存到
outputs/YYYY-MM-DD/目录,文件名为提示词摘要+种子+分辨率。
也可以将其作为 Python 库调用,核心 API 为ltx_video.inference中的infer()与InferenceConfig,方便集成到自己的服务里。
核心功能详解
文本生成视频(Text-to-Video)
即上文的默认用法。提示词建议写成"按时间顺序描述动作与镜头"的单段落形式:先写主要动作,再补充运动细节、角色外观、背景环境、镜头角度、光线与色彩。官方提示词增强机制会在提示词短于 120 词(prompt_enhancement_words_threshold)时自动调用 Florence-2 图像描述模型 + Llama-3.2-3B 对提示词做扩写,长提示词则直接使用。
图像生成视频(Image-to-Video)
通过--conditioning_media_paths传入一张图片并指定其在成片中的起始帧:
python inference.py --prompt "PROMPT" --conditioning_media_paths image.jpg --conditioning_start_frames 0 --height 704 --width 1216 --num_frames 121 --pipeline_config configs/ltxv-13b-0.9.8-distilled.yaml关键参数:
--conditioning_start_frames:条件帧在生成视频中的位置,0表示以该图为首帧;--conditioning_strengths:条件强度(0~1,默认 1.0),多条件时逐个指定;--image_cond_noise_scale(默认 0.15):对条件图像添加的噪声量,影响结果与参考图的偏离程度。
多条件生成与视频延长
--conditioning_media_paths支持同时传入多张图片或多段短视频,实现"多关键帧"式条件控制,或把一段已有视频接长(前后均可)。两个约束必须满足,否则会报ValueError:输入视频段帧数必须是 8 的倍数加 1(如 9、17、25 帧),目标总帧数需为 8 的倍数;条件列表、强度列表、起始帧列表三者长度必须一致。
模型与管线配置选择
configs/ 目录按"模型版本 + 精度"组织,常用的有:
| 配置文件 | 说明 |
|---|---|
| ltxv-13b-0.9.8-dev.yaml | 13B 完整模型,质量最高,显存需求最大,两阶段共约 60 步 |
| ltxv-13b-0.9.8-distilled.yaml | 13B 蒸馏版,两阶段合计约 10 步,无需 CFG/STG,适合快速迭代 |
| ltxv-13b-0.9.8-distilled-fp8.yaml | 蒸馏版 FP8 量化,precision: float8_e4m3fn,显存占用更低,需 Q8 Kernels |
| ltxv-2b-0.9.8-distilled.yaml | 2B 蒸馏版,显存需求最轻,质量略低于 13B |
0.9.8 系列配置均为multi-scale(多尺度)管线:first_pass以downscale_factor: 0.6666666的低分辨率先出整体结构,second_pass再借助spatial_upscaler上采样精修细节,这是官方推荐的"先快后精"渲染方式。
参数调优与性能参考
以下为官方 README 给出的参数建议及源码中的实际行为,可据此调优:
- 分辨率与帧数:宽高需能被 32 整除、帧数需为 N×8+1(如 257);不满足时
inference.py会自动 pad 再裁回目标尺寸。官方经验值是 720×1280 以下、257 帧以内效果最佳。 - Guidance Scale:建议 3~3.5。注意蒸馏模型配置中
guidance_scale: 1,即不需要 CFG 与 STG;dev 模型才使用较高的 guidance 与stg_scale。 - 采样步数:追求质量可加步数(40+),追求速度可降到 20~30;蒸馏模型 8 步即可。
- 显存不足时:优先改用 FP8 配置文件或 2B 模型;
inference.py在显存小于 30GB 时还会自动对部分模块做 CPU offload(offload_to_cpu)。 - 负向提示词:默认为
worst quality, inconsistent motion, blurry, jittery, distorted,可按内容追加。 - 随机采样:配置中
stochastic_sampling用于蒸馏模型,官方称可改善视觉质量(经验建议:蒸馏模型效果不理想时可尝试开启)。
常见问题与排障
- FP8 配置报 "Q8-Kernels not found":FP8 权重需要单独安装官方 Q8 Kernels 才能运行,或改回
bfloat16配置。 - 条件生成报 ValueError:检查条件媒体数量、
--conditioning_strengths、--conditioning_start_frames三者数量是否一致;起始帧必须落在0 ~ num_frames-1区间。 - 视频延长失败:确认输入视频帧数为 8n+1,输出总帧数为 8 的倍数。
- 首次运行较慢:属正常现象,权重、PixArt 文本编码器及提示词增强模型均会触发一次 Hub 下载,之后走本地缓存。
- 输出被裁切或留黑边:输入图/视频会先中心裁剪到目标宽高比再缩放,比例差异大时请留意构图。
延伸资源
- 管线实现(含
LTXVideoPipeline与多尺度管线):ltx_video/pipelines/ - 3D Transformer 与注意力实现:ltx_video/models/transformers/
- 因果视频 VAE 与上采样器:ltx_video/models/autoencoders/
- 整流流(Rectified Flow)调度器:ltx_video/schedulers/rf.py
- 推理入口与全部命令行参数(
python inference.py --help):inference.py - 测试用例(配置校验、推理、VAE、调度器):tests/
【免费下载链接】LTX-VideoOfficial repository for LTX-Video项目地址: https://gitcode.com/GitHub_Trending/ltx/LTX-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考