☰
Seedance 2.0 提示词哲学:Intent vs Precision —— 文本表达意图,参考承载精度
2026/9/28 7:00:09 网站建设 项目流程
  • AI 技能
  • AI 评测
  • 提示工程
  • 人工智能
  • 媒体生成

【免费下载链接】seedance-2.0

Comprehensive production pipeline for quad-modal AI filmmaking with Seedance 2.0

项目地址:https://gitcode.com/gh_mirrors/se/seedance-2.0
点击查看免费下载

Seedance 2.0 的提示词不是逐像素的剧本。本指南是seedance-2.0开源仓库中关于提示词编写核心哲学的中枢文档:文本负责表达意图,参考资源负责承载密集的视觉信息。读完本文,你将掌握"文本该写什么、参考该放什么"的完整分工清单,学会把短提示词写成"密集而非含糊"的实战句式,并能将这套原则落地到真实的预算分配与多参考资产管理流程中。

一、核心原则:意图与精度的分工

Seedance prompting is not pixel scripting. The text should direct intent; references should carry dense visual information.

这是[intent-vs-precision.md](https://link.gitcode.com/i/7aa01fbec387f82d5a2b5b1dc25b3d4e)的第一原则:提示词(prompting)不是像素脚本(pixel scripting)。

在传统图像生成的工作流里,人们习惯用大量文字去逐像素描述画面——某个物体长什么样、穿什么、处在什么位置。但在 Seedance 2.0 的四模态(文本、图像、视频、音频)管线里,这种思路是错误的:

  • 文本的职责是"导演意图":告诉模型发生了什么、观众应该感受到什么、镜头怎么运动。
  • 参考资源(references)的职责是"视觉精度":把密集的、难以用语言精确描述的视觉事实(人脸长相、产品设计、材质观感)直接以图像、视频、音频的形式喂给模型。

这种分工的深层原因,可以从仓库的 prompt-compiler.md 中找到印证:prompt_carriers是"审计边界而非魔法词",文本每一句都要花"预算";而[reference-workflow.md](https://link.gitcode.com/i/f224c6273fc25b56f495f826eb4f66ff)则直接说明"文本重复描述参考资源已展示的内容 = 预算浪费",当文字与像素不一致时,文字反而会变成漂移指令(drift instruction)。

二、用文本表达什么:六个职责域

职责域文本应表达的内容
action(动作)屏幕上可见的变化、行为、肢体动作
emotional intent(情绪意图)观众应感受到什么(但不能用抽象情绪词,见下文)
camera behavior(镜头行为)镜头运动方式、起点、终点
timing(时序)事件的先后顺序、节奏
light changes(光线变化)光源方向、光色、氛围转变
audio(音频)对白、环境声、音效、音乐、静默
constraints(约束)必须保持不变的、被排除的内容

这六个职责域与仓库 skills/seedance-prompt/SKILL.md 中"Director Formula"的七槽位高度一致(Subject + Action + Scene + Camera + Lighting/Style + Audio + Constraints),其中 Action、Camera、Lighting、Audio、Constraints 五个槽位恰好对应上面表格的文本职责域。Skill 中对每个槽位给出了可直接套用的模式,例如:

  • Action:condensation beads form and slide down the glass over five seconds
  • Camera:slow dolly-in from medium product shot to macro label detail
  • Constraints:do not alter logo, shape, label, or cap geometry

三、用参考表达什么:六个精度域

职责域参考应承载的内容
identity(身份)人脸长相、角色身份、一致性
product design(产品设计)产品形态、logo、材质、包装
motion examples(动作示例)特定动作的示范(如一段舞蹈、一个转身)
camera rhythm(镜头节奏)镜头运动的节奏、运镜风格
voice or sound texture(声音质感)音色、声音纹理、音乐质感
material appearance(材质外观)表面材质、光照下的外观

这些精度域正是[reference-workflow.md](https://link.gitcode.com/i/f224c6273fc25b56f495f826eb4f66ff)中"Asset Role Map"的输入。该表给出了每个资产类型适合的角色:

资产好角色要避免
Imageidentity、product、pose、costume、environment、first frame、last frame让它定义看不见的运动
Videomotion、camera、pacing、blocking、timing、gesture rhythm复制受保护的身份、logo 或场景所有权
Audiorhythm、tempo、mood、ambience、delivery tone、music texture假定语音、歌曲或肖像授权
Text briefaction、genre、camera plan、constraints用模糊的情绪词取代具体的参考角色

关键纪律:给每个参考资产写注释时,必须"带上它干的活"(@Image1 as the first frame、follow @Video1 for camera movement、@Audio1 for background music),永远不要只写孤零零的标签;同时保持标签字面原样——不要翻译、不要重新编号、不要改写成方括号形式,因为平台的@解析器不识别[Image1]这种写法,写错的标签会静默失效。

四、短提示词要"密集"而非"含糊"

Short prompts should be dense, not vague.

这句话是本文档最容易被忽视、却最具操作性的论断。它的含义是:短 ≠ 空。

  • 含糊(vague):make it cinematic、beautiful, high quality, stunning——这些是空转的形容词,不携带任何可执行信息,是 anti-slop-lexicon.md 与 seedance-antislop/SKILL.md 明确要求删除的"空洞强化词(hollow boosters)"。
  • 密集(dense):在有限字数内塞入高信息密度的生产语言——具体的动词、具体的镜头端点、具体的约束。

仓库 quick-ref.md 提供了一组"快速修复短语",正是"密集不含糊"的落地模板:

失败现象替换为
I2V 漂移preserve @Image1 subject/product exactly; only motion, light, and camera change
画面过于泛化physical light source + material behavior + specific camera endpoint
镜头混乱one controlled [move] from [start frame] to [end frame]
动作无力actor + verb + timing + consequence + final state

注意这些模板的共同点:每个短语都指定了可观察的载体(visible carriers),而不是情绪词。这与 directors-read.md 的"Compile to Carriers"原则完全一致——内部阅读记录(POV、power shift、subtext 等)永远不出现在最终提示词里,只有"可拍摄或可听"的载体才进入生成文本。

五、把分工落到实处:预算分配模型

文本表达意图、参考承载精度,落到工程层面就是预算分配:每一次生成都有有限的保真度预算,而"什么都想要"的提示词只会得到"处处平庸"的结果。这就是 allocation-model.md(本文档的操作性伴侣文档,在原文中以链接形式给出)的核心前提。

三种支出(Three Spends)

支出项买到什么挤压什么
身份保真度(Identity fidelity)稳定的脸、产品、logo、服装动作范围;每一个大胆动作都有漂移风险
动作力度(Motion boldness)坚决的动作、物理、编舞特写身份细节,尤其是脸和手
场景密度(Scene density)人群、分层环境、天气、道具每个主体的稳定性;微小的背景细节会退化

分配方法(五步)

  1. 指定主支出:这一镜是为了哪一件事?每次生成只有一个主支出。
  2. 选一个次要支出;其他一切刻意节省。
  3. 把保真度卸载到参考:身份由@Image1承载,就是文本不再花的预算,从而释放散文空间去写动作和时序。
  4. 用其他支出为它买单:大胆动作会压低面部细节——所以把情绪放在肢体和走位上、节约特写;密集场景会压低主体精度——所以让主角主体在画面里保持大而少。
  5. 跨序列重新锚定:链式生成会漂移,所以每隔几个片段重新在身份上花钱(用原始参考,而不是输出结果)。

工作分配示例(Worked Allocations)

镜头主支出次要支出节省项
产品广告产品身份(参考锚定)一个材质运动节拍场景密度、人群、天气
舞蹈/动作动作力度(捐赠者@Video1)通过@Image1重新锚定身份面部特写、布景
建立世界观的镜头场景密度与氛围镜头运动角色身份(无特写主体)
对白特写面部稳定(锁机)对白台词运动、背景活动

权衡表(Trade Table)

如果这镜需要它付出什么
大胆动作 + 特写脸二选一;把情绪放在姿态与走位里,或切一个单独的特写镜头
很多主体每个主体的身份精度;挑一个主角,让其余读作形状
可读的屏幕文字什么都不付出——把文字移到后期
拥挤的画面 + 微小产品细节细节;把产品节拍孤立在单独镜头里

写前清单

对于序列项目,先分配当前片段,再分配整个故事。完整故事拥有目标与最终结局;当前片段只拥有一个动作、一个终点,以及下一次交接所需的连续性锁。未来的节拍不属于当前提示词的预算。

  1. 这一镜是为了什么——身份、动作,还是世界?
  2. 哪些参考承载保真度,让文本不必承担?
  3. 刻意节省了什么,并且这个节省是否被写成了一条约束?
  4. 如果问题 1 的答案是"三者都要",哪些节拍要拆分成单独的镜头或生成?

六、参考工作流:精度域的可操作落地

精度域清单要真正生效,必须配合 reference-workflow.md 的完整资产角色映射与工作流模式。

工作流特定句式

工作流使用避免
多模态参考@Image1 controls product identity; @Video1 controls camera rhythm; @Audio1 controls tempo only.Use all references for style.
视频编辑@Video1 is the source clip; preserve composition and timing, change only [lighting/background/VFX].从零重建整个概念
视频延伸@Video1 is the previous clip; continue the same shot for [duration] and preserve last-frame continuity.无连续性锚点地开新场景
首/末帧@Image1 is first frame; @Image2 is final visual target; generate the continuous transition only.让末帧只表达"情绪"
音频参考@Audio1 controls tempo and energy; do not copy protected voice, song, or performance identity.把音频当作授权证明

动作迁移(Motion Transfer)

这是仓库标为"实地观察技术、测试后再承诺结果"的能力,也可能是最被低估的参考能力:一个捐赠者视频驱动编舞或镜头节奏,而一张图片保持身份。

  • 将一个捐赠者@Video1与一个身份锚点@Image1配对,并显式写出排除项:@Video1 controls the choreography only - nothing of its appearance, performer, costume, room, or logo transfers.
  • 选只有一个清晰动作、干净剪影、稳定镜头的捐赠片段;嘈杂的多人群像转移的是噪声而不是动作。
  • 上传前静音捐赠者片段,除非它的声音应驱动节奏;若保留声音,要声明哪个参考"拥有时钟"。
  • 迁移得好:编舞、手势时序、镜头节奏、走位。迁移得差:精细手部细节、多人同步、面部表演。
  • 只使用自有、授权、股票、动捕、排练或自录的捐赠素材;真人捐赠者只迁移一般动作,绝不迁移肖像。

通用模板

@Image1 controls product identity. @Video1 controls camera pace only. @Audio1 controls tempo only. Preserve the subject from @Image1; do not copy characters, logos, music, voice, or environment from @Video1/@Audio1.

七、意图与精度在序列中的边界

在序列项目中,意图与精度的分工还有一条额外的规则:参考标签与连续性锁不可被覆盖。reference-workflow.md明确禁止"让动作参考覆盖连续性锁、已完成节拍、保留节拍或精确参考标签"。

[prompt-compiler.md](https://link.gitcode.com/i/4b10915cc73b1095f7055aeb45027c4e)的"Source-Carries-State Rule"进一步给出了三种情况的文本职责:

  • 已接受的片段作为视频参考:片段承载静态与动态状态。文本只写参考角色(用精确标签)、当前动作与终点、排除项,以及已知漂移风险的连续性锁。
  • 已接受的末帧作为图像参考:帧只承载静态状态。文本必须承载静态图无法展示的东西——开放运动向量、镜头运动相位、音频相位——然后是当前动作、终点与排除项。
  • 无视觉源附加:用散文写出观察到的开场状态,如同跨会话延续中素材不可用的情况。

而 i2v-guide.md 的"核心规则"是这条分工在图像-视频方向的直接推论:只提示图像无法展示的内容。静态图像已包含主体身份、产品形态、服装、调色、构图与背景,重述这些静态细节常引发漂移;应补充运动、镜头、时序、变换、光照变化、音频与保持约束。

八、实践检查清单

写作前用下面的检查表自检,确保文本与参考各司其职:

  1. 参考先于形容词:先给每个上传资产分配一个主角色,再写风格语言(seedance-prompt/SKILL.md 的 Prompt Build Process)。
  2. 只写意图,不写像素:动作、情绪意图、镜头、时序、光变、音频、约束交给文本;身份、产品、动作示例、镜头节奏、声音质感、材质外观交给参考。
  3. 参考能承载的,文本不再重述:文字与像素冲突时,文字会成为漂移指令。
  4. 短而密集:删除空洞强化词,用可观察的生产语言替换。
  5. 预算单一化:每次生成只有一个主支出;"三者都要"就拆成多个镜头或多次生成。
  6. 序列中重新锚定:每几个片段用原始参考重花身份预算,防止链式漂移。

这套检查清单在根 SKILL.md 的 Load Map 中被定位为"提示词把保真度花在哪里:身份 vs 动作 vs 场景密度",与 quick-ref.md 的 Prompt checklist 相互印证——后者要求每个参考"恰好一个主角色(除非刻意分层)"、主体出现在首句、一个可见节拍有可观察终点、一个主镜头运动有起点/速度/主体关系/终点。

一句话总结:在 Seedance 2.0 中,文本是导演,参考是摄影棚;让文本负责"拍什么"(意图),让参考负责"长什么样"(精度),并把两者都装进一个有限的预算里——这就是 Intent vs Precision 的全部内涵。

  • AI 技能
  • AI 评测
  • 提示工程
  • 人工智能
  • 媒体生成

【免费下载链接】seedance-2.0

Comprehensive production pipeline for quad-modal AI filmmaking with Seedance 2.0

项目地址:https://gitcode.com/gh_mirrors/se/seedance-2.0
点击查看免费下载

相关推荐

上一篇:拯救嵌入式JS引擎:QuickJS赞助计划如何延续轻量级革命
下一篇:gh_mirrors/1o/1on1-questions持续集成/CD:自动化测试与部署的实现

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询