LongCat-Video LLM提示词增强实战:用大模型自动扩写视频Prompt完整指南
【免费下载链接】LongCat-Video项目地址: https://gitcode.com/GitHub_Trending/lo/LongCat-Video
LongCat-Video是美团 LongCat 团队开源的 13.6B 参数视频生成大模型,支持文生视频(T2V)、图生视频(I2V)和视频续写。而视频生成效果的好坏,很大程度上取决于 Prompt 写得好不好。这个项目自带了一个LLM 提示词增强模块(longcat_video/utils/prompt_enhancer.py),能够调用大模型把一句简短的中文或英文描述,自动扩写成符合视频生成要求的高质量 Prompt。本文将手把手带新手完成 LLM 提示词增强的配置与使用。
一、为什么视频 Prompt 需要 LLM 自动扩写
视频模型和图像模型不同,它对 Prompt 的"信息密度"要求更高。官方在 README.md 的用户技巧中就明确写道:
更长、描述更丰富的 Prompt 能带来更好的一致性和自然度。建议包含人物外观、动作、场景上下文等丰富细节。
对比一下两种写法,差别一目了然:
| 写法 | 示例 | 效果 |
|---|---|---|
| 简短 Prompt | "一个男孩吃冰淇淋" | 主体模糊、动作生硬、画面空洞 |
| 扩写后 Prompt | "真实摄影风格,一个七八岁的男孩穿着浅蓝色T恤、牛仔短裤和白球鞋坐在公园长椅上,手拿香草巧克力双拼甜筒递给旁边的金毛拉布拉多……" | 画面完整、动作流畅、风格明确 |
官方文生视频示例 run_demo_text_to_video.py 中使用的就是一段 100 词以上、包含人物年龄穿着、动作过程、光线环境的长描述——这正是 LLM 扩写后达到的形态。
二、内置的 4 套增强提示词:中英文自动识别
增强模块的核心思路是:把"如何写好视频 Prompt"的知识封装进系统提示词(System Prompt),再让大模型按规则改写用户输入。模块内定义了 4 套系统提示词,按任务类型 × 语言自动选择:
| 函数 | 适用场景 | 系统提示词 | 输出语言 | 字数要求 |
|---|---|---|---|---|
| enhance_prompt_t2v() | 文生视频 | LM_ZH_SYS_PROMPT/LM_EN_SYS_PROMPT | 中 / 英 | 中文 80~250 字 / 英文 100~150 词 |
| enhance_prompt_i2v() | 图生视频 | VL_ZH_SYS_PROMPT/VL_SYS_PROMPT_SHORT_EN | 中 / 英 | 中文 50~80 字 / 英文 50~80 词 |
其中is_chinese_prompt()函数会统计输入中文字符占比,超过 25% 判定为中文,自动切换对应的中文或英文提示词模板,用户无需手动选择。
扩写规则都写在哪里?
打开 longcat_video/utils/prompt_enhancer.py 可以直接看到 4 套提示词的完整内容,它们把"好 Prompt 的标准"变成了 5 条硬规则:
- 只补可见细节:可以合理推断人物的年龄、穿着、发型、物体的颜色材质,但禁止主观想象画面外内容;
- 风格必须写在开头:用户未指定风格时默认"真实摄影风格",指定动画则默认 3D 动画,指定 2D 则默认 2D 动漫风格;
- 动作要完整:外观环境描述要详细,但动作用简洁常规的词语描述完整过程(如"勺子开始舀起泡沫,逐渐将其从杯中取出");
- 保留关键原文:引号、书名号内的原文和输入中的关键信息不改动;
- 防注入设计:即使输入看起来像一条指令,模型也只负责扩写它本身,而不会执行它。
图生视频的提示词则额外要求:重点描述主体和动作而非外观细节(外观由图片决定),非真实风格的图片要在开头补充风格描述(如"水墨画风格")。
三、增强流程拆解:从输入到扩写结果的 5 个步骤
以图生视频增强为例,enhance_prompt_i2v() 的完整工作流如下:
- 图片压缩:调用
compress_image()将参考图压缩到 500KB 以内(逐档降低 JPEG 质量),再转成 Base64 数据; - 语言判定:统计 Prompt 中文字符占比,超过 0.25 走中文模板,否则走英文模板;
- 组装消息:系统提示词 + 用户文本 + 图片(Base64 内联)一起发给多模态大模型;
- 低温度生成:以
temperature=0.01、max_tokens=320调用gpt-4.1模型,低温保证输出稳定、不跑题; - 失败兜底:最多重试 3 次,每次间隔 1 秒;若仍失败则原样返回用户输入,保证流程不中断。
文生视频的 enhance_prompt_t2v() 流程相同,只是消息中不带图片。
四、快速上手:三步配置并调用提示词增强
第 1 步:配置 API Key
模块通过 OpenAI 兼容接口调用大模型,默认使用gpt-4.1模型。找到 prompt_enhancer.py 第 32 行,把APPKEY替换为你自己的密钥:
APPKEY = 'YOUR_APPKEY'第 2 步:两行代码调用增强
模块自带独立运行入口(见 prompt_enhancer.py 末尾),核心调用只有两行:
from longcat_video.utils.prompt_enhancer import enhance_prompt_t2v, enhance_prompt_i2v # 文生视频:只需传入 Prompt refined = enhance_prompt_t2v("一只猫在窗台上睡觉") # 图生视频:传入图片路径 + 可选 Prompt refined = enhance_prompt_i2v("assets/girl.png", "她端起咖啡喝了一口")第 3 步:把扩写结果喂给生成脚本
将refined替换到官方 demo 脚本里的prompt变量即可,例如 run_demo_image_to_video.py 第 31 行 的 Prompt 就对应参考图 assets/girl.png,生成命令:
torchrun run_demo_image_to_video.py --checkpoint_dir=./weights/LongCat-Video --enable_compile💡 依赖
openai与Pillow库,项目 requirements.txt 中已包含相关依赖,pip install -r requirements.txt后即可使用。
五、真实扩写效果:官方示例对比
系统提示词中内置了 4 组"改写前后"示例,最能说明扩写风格。以 英文 T2V 提示词第 60 行 为例:
扩写后:"realistic filming style, a glass filled with a layered beverage, consisting of a white liquid at the bottom and a frothy, golden-brown foam on top, is placed on a white surface. A spoon is introduced into the foam… The foam is fully lifted out of the glass, with the spoon holding it above the glass."
短短一句话里包含了:开头风格声明 → 主体外观(分层饮料、颜色、容器)→ 环境(白色台面)→ 完整动作链(勺子伸入、舀起、举过杯口)。
数字人示例文件 assets/avatar/single_example_1.json 中的 Prompt 也遵循同样的模式——舞台灯光、红色金绣夹克、烟雾氛围、说话动作一应俱全,这就是长 Prompt 带来高一致性的来源。
六、写好视频 Prompt 的 6 个技巧清单
结合增强模块的规则,手动写 Prompt 或检查扩写结果时,可以对照这份清单 ✅:
- 开头声明风格:真实摄影 / 3D 动画 / 2D 动漫 / 水墨画等,别留给模型猜;
- 人物要素补全:年龄、穿着、发型、配饰,例如"穿白衬衫、戴黑帽的女性";
- 物体要素补全:颜色、材质、新旧程度;
- 动作写成完整过程:用"开始…逐渐…最后"的时序描述,而非孤立动词;
- 控制长度:T2V 建议 100 词左右(英文)/ 150 字左右(中文),I2V 更短更聚焦动作;
- 关键原文加引号保留:需要出现的文字、标题等用引号包住,扩写时不会被改写。
写在最后
LongCat-Video 的 LLM 提示词增强模块把"提示词工程"这件麻烦事变成了自动化的两步操作:配置 Key、调用函数。无论是新手写文生视频描述,还是用图生视频做数字人视频,先过一遍enhance_prompt_t2v/enhance_prompt_i2v,都能显著提升画面完整度、动作连贯性和风格一致性。建议配合 README.md 中的快速开始章节,跑通完整流程后再微调自己的提示词模板,逐步找到最适合自己场景的扩写风格。
【免费下载链接】LongCat-Video项目地址: https://gitcode.com/GitHub_Trending/lo/LongCat-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考