- AI 技能
- AI 评测
- 提示工程
- 人工智能
- 媒体生成
【免费下载链接】seedance-2.0
Comprehensive production pipeline for quad-modal AI filmmaking with Seedance 2.0
Seedance 2.0 的提示词不是逐像素的剧本。本指南是seedance-2.0开源仓库中关于提示词编写核心哲学的中枢文档:文本负责表达意图,参考资源负责承载密集的视觉信息。读完本文,你将掌握"文本该写什么、参考该放什么"的完整分工清单,学会把短提示词写成"密集而非含糊"的实战句式,并能将这套原则落地到真实的预算分配与多参考资产管理流程中。
一、核心原则:意图与精度的分工
Seedance prompting is not pixel scripting. The text should direct intent; references should carry dense visual information.
这是[intent-vs-precision.md](https://link.gitcode.com/i/7aa01fbec387f82d5a2b5b1dc25b3d4e)的第一原则:提示词(prompting)不是像素脚本(pixel scripting)。
在传统图像生成的工作流里,人们习惯用大量文字去逐像素描述画面——某个物体长什么样、穿什么、处在什么位置。但在 Seedance 2.0 的四模态(文本、图像、视频、音频)管线里,这种思路是错误的:
- 文本的职责是"导演意图":告诉模型发生了什么、观众应该感受到什么、镜头怎么运动。
- 参考资源(references)的职责是"视觉精度":把密集的、难以用语言精确描述的视觉事实(人脸长相、产品设计、材质观感)直接以图像、视频、音频的形式喂给模型。
这种分工的深层原因,可以从仓库的 prompt-compiler.md 中找到印证:prompt_carriers是"审计边界而非魔法词",文本每一句都要花"预算";而[reference-workflow.md](https://link.gitcode.com/i/f224c6273fc25b56f495f826eb4f66ff)则直接说明"文本重复描述参考资源已展示的内容 = 预算浪费",当文字与像素不一致时,文字反而会变成漂移指令(drift instruction)。
二、用文本表达什么:六个职责域
| 职责域 | 文本应表达的内容 |
|---|---|
| action(动作) | 屏幕上可见的变化、行为、肢体动作 |
| emotional intent(情绪意图) | 观众应感受到什么(但不能用抽象情绪词,见下文) |
| camera behavior(镜头行为) | 镜头运动方式、起点、终点 |
| timing(时序) | 事件的先后顺序、节奏 |
| light changes(光线变化) | 光源方向、光色、氛围转变 |
| audio(音频) | 对白、环境声、音效、音乐、静默 |
| constraints(约束) | 必须保持不变的、被排除的内容 |
这六个职责域与仓库 skills/seedance-prompt/SKILL.md 中"Director Formula"的七槽位高度一致(Subject + Action + Scene + Camera + Lighting/Style + Audio + Constraints),其中 Action、Camera、Lighting、Audio、Constraints 五个槽位恰好对应上面表格的文本职责域。Skill 中对每个槽位给出了可直接套用的模式,例如:
- Action:
condensation beads form and slide down the glass over five seconds - Camera:
slow dolly-in from medium product shot to macro label detail - Constraints:
do not alter logo, shape, label, or cap geometry
三、用参考表达什么:六个精度域
| 职责域 | 参考应承载的内容 |
|---|---|
| identity(身份) | 人脸长相、角色身份、一致性 |
| product design(产品设计) | 产品形态、logo、材质、包装 |
| motion examples(动作示例) | 特定动作的示范(如一段舞蹈、一个转身) |
| camera rhythm(镜头节奏) | 镜头运动的节奏、运镜风格 |
| voice or sound texture(声音质感) | 音色、声音纹理、音乐质感 |
| material appearance(材质外观) | 表面材质、光照下的外观 |
这些精度域正是[reference-workflow.md](https://link.gitcode.com/i/f224c6273fc25b56f495f826eb4f66ff)中"Asset Role Map"的输入。该表给出了每个资产类型适合的角色:
| 资产 | 好角色 | 要避免 |
|---|---|---|
| Image | identity、product、pose、costume、environment、first frame、last frame | 让它定义看不见的运动 |
| Video | motion、camera、pacing、blocking、timing、gesture rhythm | 复制受保护的身份、logo 或场景所有权 |
| Audio | rhythm、tempo、mood、ambience、delivery tone、music texture | 假定语音、歌曲或肖像授权 |
| Text brief | action、genre、camera plan、constraints | 用模糊的情绪词取代具体的参考角色 |
关键纪律:给每个参考资产写注释时,必须"带上它干的活"(@Image1 as the first frame、follow @Video1 for camera movement、@Audio1 for background music),永远不要只写孤零零的标签;同时保持标签字面原样——不要翻译、不要重新编号、不要改写成方括号形式,因为平台的@解析器不识别[Image1]这种写法,写错的标签会静默失效。
四、短提示词要"密集"而非"含糊"
Short prompts should be dense, not vague.
这句话是本文档最容易被忽视、却最具操作性的论断。它的含义是:短 ≠ 空。
- 含糊(vague):
make it cinematic、beautiful, high quality, stunning——这些是空转的形容词,不携带任何可执行信息,是 anti-slop-lexicon.md 与 seedance-antislop/SKILL.md 明确要求删除的"空洞强化词(hollow boosters)"。 - 密集(dense):在有限字数内塞入高信息密度的生产语言——具体的动词、具体的镜头端点、具体的约束。
仓库 quick-ref.md 提供了一组"快速修复短语",正是"密集不含糊"的落地模板:
| 失败现象 | 替换为 |
|---|---|
| I2V 漂移 | preserve @Image1 subject/product exactly; only motion, light, and camera change |
| 画面过于泛化 | physical light source + material behavior + specific camera endpoint |
| 镜头混乱 | one controlled [move] from [start frame] to [end frame] |
| 动作无力 | actor + verb + timing + consequence + final state |
注意这些模板的共同点:每个短语都指定了可观察的载体(visible carriers),而不是情绪词。这与 directors-read.md 的"Compile to Carriers"原则完全一致——内部阅读记录(POV、power shift、subtext 等)永远不出现在最终提示词里,只有"可拍摄或可听"的载体才进入生成文本。
五、把分工落到实处:预算分配模型
文本表达意图、参考承载精度,落到工程层面就是预算分配:每一次生成都有有限的保真度预算,而"什么都想要"的提示词只会得到"处处平庸"的结果。这就是 allocation-model.md(本文档的操作性伴侣文档,在原文中以链接形式给出)的核心前提。
三种支出(Three Spends)
| 支出项 | 买到什么 | 挤压什么 |
|---|---|---|
| 身份保真度(Identity fidelity) | 稳定的脸、产品、logo、服装 | 动作范围;每一个大胆动作都有漂移风险 |
| 动作力度(Motion boldness) | 坚决的动作、物理、编舞 | 特写身份细节,尤其是脸和手 |
| 场景密度(Scene density) | 人群、分层环境、天气、道具 | 每个主体的稳定性;微小的背景细节会退化 |
分配方法(五步)
- 指定主支出:这一镜是为了哪一件事?每次生成只有一个主支出。
- 选一个次要支出;其他一切刻意节省。
- 把保真度卸载到参考:身份由
@Image1承载,就是文本不再花的预算,从而释放散文空间去写动作和时序。 - 用其他支出为它买单:大胆动作会压低面部细节——所以把情绪放在肢体和走位上、节约特写;密集场景会压低主体精度——所以让主角主体在画面里保持大而少。
- 跨序列重新锚定:链式生成会漂移,所以每隔几个片段重新在身份上花钱(用原始参考,而不是输出结果)。
工作分配示例(Worked Allocations)
| 镜头 | 主支出 | 次要支出 | 节省项 |
|---|---|---|---|
| 产品广告 | 产品身份(参考锚定) | 一个材质运动节拍 | 场景密度、人群、天气 |
| 舞蹈/动作 | 动作力度(捐赠者@Video1) | 通过@Image1重新锚定身份 | 面部特写、布景 |
| 建立世界观的镜头 | 场景密度与氛围 | 镜头运动 | 角色身份(无特写主体) |
| 对白特写 | 面部稳定(锁机) | 对白台词 | 运动、背景活动 |
权衡表(Trade Table)
| 如果这镜需要 | 它付出什么 |
|---|---|
| 大胆动作 + 特写脸 | 二选一;把情绪放在姿态与走位里,或切一个单独的特写镜头 |
| 很多主体 | 每个主体的身份精度;挑一个主角,让其余读作形状 |
| 可读的屏幕文字 | 什么都不付出——把文字移到后期 |
| 拥挤的画面 + 微小产品细节 | 细节;把产品节拍孤立在单独镜头里 |
写前清单
对于序列项目,先分配当前片段,再分配整个故事。完整故事拥有目标与最终结局;当前片段只拥有一个动作、一个终点,以及下一次交接所需的连续性锁。未来的节拍不属于当前提示词的预算。
- 这一镜是为了什么——身份、动作,还是世界?
- 哪些参考承载保真度,让文本不必承担?
- 刻意节省了什么,并且这个节省是否被写成了一条约束?
- 如果问题 1 的答案是"三者都要",哪些节拍要拆分成单独的镜头或生成?
六、参考工作流:精度域的可操作落地
精度域清单要真正生效,必须配合 reference-workflow.md 的完整资产角色映射与工作流模式。
工作流特定句式
| 工作流 | 使用 | 避免 |
|---|---|---|
| 多模态参考 | @Image1 controls product identity; @Video1 controls camera rhythm; @Audio1 controls tempo only. | Use all references for style. |
| 视频编辑 | @Video1 is the source clip; preserve composition and timing, change only [lighting/background/VFX]. | 从零重建整个概念 |
| 视频延伸 | @Video1 is the previous clip; continue the same shot for [duration] and preserve last-frame continuity. | 无连续性锚点地开新场景 |
| 首/末帧 | @Image1 is first frame; @Image2 is final visual target; generate the continuous transition only. | 让末帧只表达"情绪" |
| 音频参考 | @Audio1 controls tempo and energy; do not copy protected voice, song, or performance identity. | 把音频当作授权证明 |
动作迁移(Motion Transfer)
这是仓库标为"实地观察技术、测试后再承诺结果"的能力,也可能是最被低估的参考能力:一个捐赠者视频驱动编舞或镜头节奏,而一张图片保持身份。
- 将一个捐赠者
@Video1与一个身份锚点@Image1配对,并显式写出排除项:@Video1 controls the choreography only - nothing of its appearance, performer, costume, room, or logo transfers. - 选只有一个清晰动作、干净剪影、稳定镜头的捐赠片段;嘈杂的多人群像转移的是噪声而不是动作。
- 上传前静音捐赠者片段,除非它的声音应驱动节奏;若保留声音,要声明哪个参考"拥有时钟"。
- 迁移得好:编舞、手势时序、镜头节奏、走位。迁移得差:精细手部细节、多人同步、面部表演。
- 只使用自有、授权、股票、动捕、排练或自录的捐赠素材;真人捐赠者只迁移一般动作,绝不迁移肖像。
通用模板
@Image1 controls product identity. @Video1 controls camera pace only. @Audio1 controls tempo only. Preserve the subject from @Image1; do not copy characters, logos, music, voice, or environment from @Video1/@Audio1.
七、意图与精度在序列中的边界
在序列项目中,意图与精度的分工还有一条额外的规则:参考标签与连续性锁不可被覆盖。reference-workflow.md明确禁止"让动作参考覆盖连续性锁、已完成节拍、保留节拍或精确参考标签"。
[prompt-compiler.md](https://link.gitcode.com/i/4b10915cc73b1095f7055aeb45027c4e)的"Source-Carries-State Rule"进一步给出了三种情况的文本职责:
- 已接受的片段作为视频参考:片段承载静态与动态状态。文本只写参考角色(用精确标签)、当前动作与终点、排除项,以及已知漂移风险的连续性锁。
- 已接受的末帧作为图像参考:帧只承载静态状态。文本必须承载静态图无法展示的东西——开放运动向量、镜头运动相位、音频相位——然后是当前动作、终点与排除项。
- 无视觉源附加:用散文写出观察到的开场状态,如同跨会话延续中素材不可用的情况。
而 i2v-guide.md 的"核心规则"是这条分工在图像-视频方向的直接推论:只提示图像无法展示的内容。静态图像已包含主体身份、产品形态、服装、调色、构图与背景,重述这些静态细节常引发漂移;应补充运动、镜头、时序、变换、光照变化、音频与保持约束。
八、实践检查清单
写作前用下面的检查表自检,确保文本与参考各司其职:
- 参考先于形容词:先给每个上传资产分配一个主角色,再写风格语言(seedance-prompt/SKILL.md 的 Prompt Build Process)。
- 只写意图,不写像素:动作、情绪意图、镜头、时序、光变、音频、约束交给文本;身份、产品、动作示例、镜头节奏、声音质感、材质外观交给参考。
- 参考能承载的,文本不再重述:文字与像素冲突时,文字会成为漂移指令。
- 短而密集:删除空洞强化词,用可观察的生产语言替换。
- 预算单一化:每次生成只有一个主支出;"三者都要"就拆成多个镜头或多次生成。
- 序列中重新锚定:每几个片段用原始参考重花身份预算,防止链式漂移。
这套检查清单在根 SKILL.md 的 Load Map 中被定位为"提示词把保真度花在哪里:身份 vs 动作 vs 场景密度",与 quick-ref.md 的 Prompt checklist 相互印证——后者要求每个参考"恰好一个主角色(除非刻意分层)"、主体出现在首句、一个可见节拍有可观察终点、一个主镜头运动有起点/速度/主体关系/终点。
一句话总结:在 Seedance 2.0 中,文本是导演,参考是摄影棚;让文本负责"拍什么"(意图),让参考负责"长什么样"(精度),并把两者都装进一个有限的预算里——这就是 Intent vs Precision 的全部内涵。
- AI 技能
- AI 评测
- 提示工程
- 人工智能
- 媒体生成
【免费下载链接】seedance-2.0
Comprehensive production pipeline for quad-modal AI filmmaking with Seedance 2.0
相关推荐
Seedance 2.0 首帧/尾帧(FLF2V)转场控制指南:参考角色锁定、提示词模板与失败修复
Seedance 2.0 首帧/尾帧(FLF2V)转场控制指南:参考角色锁定、提示词模板与失败修复 本指南围绕 Seedance 2.0 的 FLF2V(Fir
AI 技能AI 评测提示工程人工智能媒体生成LangGPT哲学思考:AI提示词的伦理与道德边界
LangGPT哲学思考:AI提示词的伦理与道德边界 在人工智能技术快速发展的今天,LangGPT项目以其独特的结构化提示词技术,正在重新定义我们与AI交互的方式
提示工程大模型人工智能AI 技能/插件Prompt 模板seedance-2.0 类型配方模板实战:基于 seedance-recipes 的七大内容品类提示词工程指南
seedance 2.0 类型配方模板实战:基于 seedance recipes 的七大内容品类提示词工程指南 本指南以 seedance 2.0 仓库中 s
AI 技能AI 评测提示工程人工智能媒体生成
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考