如何上手 LTX-Video:实时视频生成模型的安装与使用指南
2026/9/16 19:06:00 网站建设 项目流程

如何上手 LTX-Video:实时视频生成模型的安装与使用指南

【免费下载链接】LTX-VideoOfficial repository for LTX-Video项目地址: https://gitcode.com/GitHub_Trending/ltx/LTX-Video

LTX-Video 是 Lightricks 开源的基于 DiT(Diffusion Transformer)架构的视频生成模型,官方定位为"实时视频潜扩散模型",支持文本生成视频、图像生成视频、多关键帧条件控制、视频前后向延长以及视频到视频转换等能力,且这些功能可以在同一个模型中自由组合。模型默认输出 1216×704 分辨率、30 FPS 的视频,蒸馏(distilled)版本在 H100 上可做到实时生成。需要注意:官方已将后续开发重心迁移到 LTX-2(支持音频+视频同步生成),本仓库对应的是 LTXV 0.9.x 系列模型,仍可用于推理和作为二次开发的基座。

效果展示

以下是仓库README.md中展示的三类生成效果,分别对应文生视频、图生视频和受控视频(IC-LoRA):

环境要求与安装

官方说明的测试环境为:Python 3.10.5、CUDA 12.2、PyTorch ≥ 2.1.2;macOS 上 MPS 后端在 PyTorch 2.3.0 下测试通过(支持 PyTorch 2.3 或 ≥ 2.6)。核心依赖包括torch>=2.1.0diffusers>=0.28.2transformers>=4.47.2,<4.52.0huggingface-hub~=0.30einopstimm等(见 pyproject.toml)。

git clone https://gitcode.com/GitHub_Trending/ltx/LTX-Video cd LTX-Video python -m venv env && source env/bin/activate python -m pip install -e .[inference]

模型权重(如ltxv-13b-0.9.8-distilled.safetensors)由inference.py在首次运行时通过 Hugging Face Hub 自动下载到本地,无需手动获取。若要在 Ada(RTX 40 系)及更新架构的显卡上启用 FP8 量化推理,还需额外安装官方的 Q8 Kernels(FP8 权重依赖该推理加速组件)。

快速上手:生成第一个视频

安装完成后,直接运行仓库根目录的 inference.py 即可。以蒸馏版 13B 模型为例执行文本生成视频:

python inference.py --prompt "A cat walking on the street, cinematic" --height 704 --width 1216 --num_frames 121 --seed 42 --pipeline_config configs/ltxv-13b-0.9.8-distilled.yaml

参数说明(均为InferenceConfig默认值,见 ltx_video/inference.py):

  • --height 704 --width 1216 --num_frames 121:即约 4 秒的 720p 级视频,是默认规格;
  • --seed:固定随机种子,用于复现同一构图与风格;
  • --pipeline_config:指定 configs/ 下的管线配置,决定用哪个权重、什么精度、走多尺度管线还是单管线;
  • 输出自动保存到outputs/YYYY-MM-DD/目录,文件名为提示词摘要+种子+分辨率。

也可以将其作为 Python 库调用,核心 API 为ltx_video.inference中的infer()InferenceConfig,方便集成到自己的服务里。

核心功能详解

文本生成视频(Text-to-Video)

即上文的默认用法。提示词建议写成"按时间顺序描述动作与镜头"的单段落形式:先写主要动作,再补充运动细节、角色外观、背景环境、镜头角度、光线与色彩。官方提示词增强机制会在提示词短于 120 词(prompt_enhancement_words_threshold)时自动调用 Florence-2 图像描述模型 + Llama-3.2-3B 对提示词做扩写,长提示词则直接使用。

图像生成视频(Image-to-Video)

通过--conditioning_media_paths传入一张图片并指定其在成片中的起始帧:

python inference.py --prompt "PROMPT" --conditioning_media_paths image.jpg --conditioning_start_frames 0 --height 704 --width 1216 --num_frames 121 --pipeline_config configs/ltxv-13b-0.9.8-distilled.yaml

关键参数:

  • --conditioning_start_frames:条件帧在生成视频中的位置,0表示以该图为首帧;
  • --conditioning_strengths:条件强度(0~1,默认 1.0),多条件时逐个指定;
  • --image_cond_noise_scale(默认 0.15):对条件图像添加的噪声量,影响结果与参考图的偏离程度。

多条件生成与视频延长

--conditioning_media_paths支持同时传入多张图片或多段短视频,实现"多关键帧"式条件控制,或把一段已有视频接长(前后均可)。两个约束必须满足,否则会报ValueError:输入视频段帧数必须是 8 的倍数加 1(如 9、17、25 帧),目标总帧数需为 8 的倍数;条件列表、强度列表、起始帧列表三者长度必须一致。

模型与管线配置选择

configs/ 目录按"模型版本 + 精度"组织,常用的有:

配置文件说明
ltxv-13b-0.9.8-dev.yaml13B 完整模型,质量最高,显存需求最大,两阶段共约 60 步
ltxv-13b-0.9.8-distilled.yaml13B 蒸馏版,两阶段合计约 10 步,无需 CFG/STG,适合快速迭代
ltxv-13b-0.9.8-distilled-fp8.yaml蒸馏版 FP8 量化,precision: float8_e4m3fn,显存占用更低,需 Q8 Kernels
ltxv-2b-0.9.8-distilled.yaml2B 蒸馏版,显存需求最轻,质量略低于 13B

0.9.8 系列配置均为multi-scale(多尺度)管线:first_passdownscale_factor: 0.6666666的低分辨率先出整体结构,second_pass再借助spatial_upscaler上采样精修细节,这是官方推荐的"先快后精"渲染方式。

参数调优与性能参考

以下为官方 README 给出的参数建议及源码中的实际行为,可据此调优:

  • 分辨率与帧数:宽高需能被 32 整除、帧数需为 N×8+1(如 257);不满足时inference.py会自动 pad 再裁回目标尺寸。官方经验值是 720×1280 以下、257 帧以内效果最佳。
  • Guidance Scale:建议 3~3.5。注意蒸馏模型配置中guidance_scale: 1,即不需要 CFG 与 STG;dev 模型才使用较高的 guidance 与stg_scale
  • 采样步数:追求质量可加步数(40+),追求速度可降到 20~30;蒸馏模型 8 步即可。
  • 显存不足时:优先改用 FP8 配置文件或 2B 模型;inference.py在显存小于 30GB 时还会自动对部分模块做 CPU offload(offload_to_cpu)。
  • 负向提示词:默认为worst quality, inconsistent motion, blurry, jittery, distorted,可按内容追加。
  • 随机采样:配置中stochastic_sampling用于蒸馏模型,官方称可改善视觉质量(经验建议:蒸馏模型效果不理想时可尝试开启)。

常见问题与排障

  • FP8 配置报 "Q8-Kernels not found":FP8 权重需要单独安装官方 Q8 Kernels 才能运行,或改回bfloat16配置。
  • 条件生成报 ValueError:检查条件媒体数量、--conditioning_strengths--conditioning_start_frames三者数量是否一致;起始帧必须落在0 ~ num_frames-1区间。
  • 视频延长失败:确认输入视频帧数为 8n+1,输出总帧数为 8 的倍数。
  • 首次运行较慢:属正常现象,权重、PixArt 文本编码器及提示词增强模型均会触发一次 Hub 下载,之后走本地缓存。
  • 输出被裁切或留黑边:输入图/视频会先中心裁剪到目标宽高比再缩放,比例差异大时请留意构图。

延伸资源

  • 管线实现(含LTXVideoPipeline与多尺度管线):ltx_video/pipelines/
  • 3D Transformer 与注意力实现:ltx_video/models/transformers/
  • 因果视频 VAE 与上采样器:ltx_video/models/autoencoders/
  • 整流流(Rectified Flow)调度器:ltx_video/schedulers/rf.py
  • 推理入口与全部命令行参数(python inference.py --help):inference.py
  • 测试用例(配置校验、推理、VAE、调度器):tests/

【免费下载链接】LTX-VideoOfficial repository for LTX-Video项目地址: https://gitcode.com/GitHub_Trending/ltx/LTX-Video

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询