做短视频这两年,我最常被问的问题不是剪映怎么用,也不是拍摄设备选什么,而是“脚本到底怎么写”。很多人觉得拍视频嘛,拿着手机走到镜头前讲就完了,结果拍出来一看,要么前言不搭后语,要么前面铺垫太长观众全跑了。我自己的习惯是:不管多短的视频,动手之前一定先把脚本大纲写出来。后来接触AI之后,我又把写大纲这件事交给了AI——不是让它替我做决定,而是通过一组提示词,让它把我脑子里的零散想法整理成一版可以直接照着拍的结构。这套东西我用了挺长时间,实践下来确实省时间,今天就把提示词公开出来,喂饭级,照着抄就行。
1. 为什么脚本大纲才是短视频的“半条命”
1.1 三条视频看完三秒划走,问题基本都出在大纲上
短视频平台是个完播率驱动的场子,系统不会看你拍得多辛苦,它只看用户停留了多久、有没有看完、有没有互动。一条视频开局三秒留不住人,后面拍得再用心也没用。我复盘过自己早期那些数据很惨的视频,发现问题的根源不在画面、不在剪辑,而在动笔之前就没把结构想清楚。
典型的情况是:开头用一句废话寒暄,比如“大家好,今天我们来聊一个非常重要的话题”,观众在第二秒就划走了;正文想到哪说到哪,没有递进也没有情绪起伏;结尾丢一句“大家记得点赞关注”就没了。这些问题靠后期剪辑救不回来,只能在脚本阶段解决。脚本大纲干的事,就是把“你这条视频要给谁看、用什么钩子把人留住、分几段讲完、最后让观众做什么”这几件事固定下来,等于给拍摄和剪辑画了一张施工图。
一张靠谱的大纲至少包含几个部分:开场钩子、正文结构的递进关系、一个具体案例或场景、结尾的互动引导,以及时长匹配。真正做过号的人都知道,大纲定了,一条视频的完成度就定了一半。剩余的一半是拍摄执行和剪辑节奏,但那属于“照图施工”,难度低很多。
1.2 AI提示词帮你做什么:把“模糊想法”变成“可执行描述”
很多人用AI写脚本,第一句话就是“帮我写一个关于职场的视频脚本”。这种问法得到的结果,基本都是正确的废话——结构是齐全的,但每条都不痛不痒,根本没法用。问题不在AI,而是提问的人没把需求讲清楚。
AI提示词的实质,是把你脑中的“模糊想法”翻译成模型能理解的“结构化描述”。你心里可能想的是:“讲一个职场沟通的干货,要有故事感,别太正式”,但你没有把受众、时长、风格、结构、禁忌告诉AI,它就只能从训练数据里找一个最通用的“职场视频”模板来应付。
我常用的AI提示词,本质上是五要素的组合:角色、任务、内容源、风格、输出格式。角色告诉AI以什么身份干活,任务告诉AI具体要交付什么,内容源告诉AI围绕什么材料和背景展开,风格约束语言和情绪,输出格式保证结果能直接用。这五个要素写清楚了,AI产出的大纲质量会稳定很多。这也是“提示词工程”里最基础但也最值钱的能力——不是会堆华丽词藻,而是会把自己的需求说人话。
这套方法影响的不只是单条视频。一旦你把提示词模板沉淀下来,批量生成选题大纲、给不同平台生成不同版本,或者把同一主题拆成系列视频,都是顺手的事。短视频创作者的工作流会从“憋灵感”变成“搭生产线”,这才是AI对内容行业真正有价值的地方。
2. 提示词工程的核心:一套五要素公式
2.1 五个要素逐个拆解:角色、任务、内容源、风格、输出格式
聊提示词工程,很多人习惯把重点放在“话术精不精妙”上,我反而觉得重点是结构。只要结构对了,哪怕用词粗糙一点,效果也不会差太多。我自己常用的公式是这样的:
角色 + 任务 + 内容源 + 风格 + 输出格式 = 可用的提示词先说角色。不要写“你是AI助手”,而要写“你是一位有8年经验的短视频编导,专注口播知识类账号,擅长把复杂观点用通俗语言讲清楚”。角色给得越具体,AI调用的表达能力就越贴近这个方向。这不是玄学,模型在训练时见过大量带有“编导”“口播”“完播率”这些词的素材,给一个清晰的职业设定,它会更自然地使用这个圈子里的表达习惯。
再说任务。任务要包含明确的动词和交付物。“写一个脚本”不如“为一条60秒的短视频写出完整的分镜脚本大纲”。动词要具体,比如“撰写”“拆解”“列出”;交付物要明确,比如“脚本大纲”“三个标题备选”“口播文案全文”。让AI知道“做完这件事交给你什么”,它就不会给一堆无关的建议。
然后是内容源。这是AI最容易发挥跑偏的地方,因为你不给它足够的信息,它只能编。内容源包括你的账号定位、目标受众、想表达的核心观点、已经准备好的素材或案例,甚至你讨厌的账号风格。信息越多,输出越贴你的实际情况。比如“我的账号是职场干货类,受众是毕业3年内的年轻人,这条视频想讲清楚向上汇报的三个误区,我手里有上周发生的一个真实沟通案例”,这么一段背景信息,能让AI的生成质量上一个台阶。
风格约束也很关键。短视频大纲最怕“官方感”。我会在提示词里明确写“口吻要像跟朋友喝茶聊天时说起这件事,不要出现‘值得注意的是’‘总而言之’这类书面连接词”。如果你有明确的参考账号,也可以直接说“语言风格参考XX类账号,节奏要快,一句一行”。
输出格式决定了结果能不能直接用。不要只让AI“列出大纲”,要规定它输出的每个部分:备选标题几个、开场钩子写成几句话、正文分几个论点、每个论点配什么画面、结尾怎么引导互动、全文口播文案多少字。我把这理解为给AI一张填空表,它按表输出,你按表验收。
2.2 两个容易踩的坑:指令太少和指令太满
五要素公式听起来不复杂,但实际操作里我见过两个很典型的坑。
第一个是指令太少。很多人写完角色和任务就结束了,结果AI生成的东西大而全,每个部分都很平庸。比如你只让它“写脚本大纲”,它可能给你输出“开头—内容—结尾”这种所有视频都通用的骨架,你拿回来还得自己重新设计钩子和节奏。解决方法是把“内容源”“风格”“输出格式”这三项填满,尤其是输出格式,宁可啰嗦也不要省略。
第二个是指令太满。我见过有人一口气写了七八条约束,要求“既有网感又不失权威”“金句多但自然”“节奏快但要有松弛感”“信息密度高但别太专业”。这里包含大量互相矛盾的描述,AI顾此失彼,最后产出的东西四不像。我的经验是,核心约束控制在3到5条,每条都是可验证的具体描述。比如“所有分镜只用一台手机加稳定器完成”“口播文案不超过260字”“不得编造数据和人物”,这些是可执行的硬条件,而不是“要有网感”这种模糊的感觉词。
这里给个实操建议:写提示词时,尽量把“不要什么”也写明白。AI对否定指令的理解虽然不完美,但比“要什么”模糊描述强很多。比如“不要用‘大家’开头”“不要出现‘今天我们来聊聊’这种话”“不要写任何需要CG特效才能完成的画面”,这些约束能让生成结果更贴近真实拍摄条件。
2.3 选模型也有讲究:写大纲不是聊天,别用“爱自由发挥”的模型
提示词写得再好,也得选对模型。我的实际经验是,写脚本大纲这件事,需要的是指令跟随能力强、逻辑结构稳定的大模型,而不是“创作欲旺盛”的对话模型。创作欲强的模型容易自由发挥,输出结构漂移,这次生成四段,下次生成七段,很难形成可复用的流程。
目前市面上的主流大模型,比如DeepSeek、豆包、Kimi、通义千问、文心一言以及GPT系列,都能完成这类任务,但体验有差别。我更推荐用支持长上下文、指令跟随比较稳的模型来生成结构化大纲,用“话痨型”模型来做语言润色。具体到你手上能用到哪个,就看哪个方便,不一定非要局限在某一个。
还有个小技巧:写大纲的时候,不要把AI对话窗口的“联网搜索”开着。联网会让模型把注意力分散到各种实时信息上,反而干扰结构生成。等你要找最新热点素材的时候再单独开一个联网对话,效率会高很多。另外,同一个提示词可以在不同模型里各跑一遍,再人工融合修改,出来的大纲往往比只跑一个模型强不少。
3. 喂饭级模板:两个可以直接复制的大纲生成器
3.1 模板A:口播/知识类账号的脚本大纲生成器
口播类账号是短视频最常见的形态,包括知识分享、观点输出、干货教学、职场经验等。这类视频的核心是“把一件事说清楚”,所以我设计的模板重点放在逻辑结构和口语化表达上。
# 角色 你是一位拥有8年短视频编导经验的内容策划,擅长口播知识类账号,你操盘过的账号平均完播率明显高于行业均值。你的强项是把复杂概念拆成生活化比喻,让观众一听就懂。 # 任务 根据我提供的信息,为一条60秒的短视频撰写一份脚本大纲。 # 内容源 - 我的账号定位:【比如:职场新人成长,专注沟通技巧和向上管理】 - 本期选题:【用一句话描述这条视频想讲什么】 - 目标受众:【比如:毕业1到3年,刚进入职场,容易陷入被动执行的年轻人】 - 核心观点:【这条视频最想让观众记住的一句话】 # 风格要求 - 语言口语化,像在跟朋友喝茶聊天时讲一个观点。 - 不用“值得注意的是”“总而言之”“首先其次”等书面连接词。 - 节奏要快,每句话尽量短,一句话一行。 # 输出格式 按以下结构输出: 1. 标题:给出3个备选标题,要求有点击欲但不过度标题党。 2. 开场钩子(0-3秒):写一个具体画面或一句有明显冲突感的话,让人有继续看下去的理由。 3. 正文结构(4-50秒):拆成3个递进部分,每个部分写清楚口播要点和对应画面建议。 4. 结尾互动(51-60秒):写出一句自然的引导评论、关注或收藏的话术。 5. 拍摄提示:列出这条视频需要的场景、道具和字幕强调点。 # 约束 - 全片口播文案控制在250到300字之间。 - 所有分镜只需要一台手机加稳定器就能完成,禁止出现复杂运镜和需要特效的画面。 - 不得编造数据、专家名言和具体案例;需要引用数据时,用“待核实数据”标记。 - 禁止用“家人们”“宝子们”等过度短视频化的口癖。使用的时候,把【】里的内容替换成自己的信息,然后整段粘贴进对话窗口。我一般还会在最后加一句“不要给我建议,不要反问,直接按格式输出”,这会减少AI的“甩建议”行为。
举个例子,如果我想讲“越努力越焦虑”这个选题,替换好变量后,AI可能会输出类似这样的大纲:标题写“你效率低,不是因为不够努力,而是没学会止损”,开场钩子写成“如果你每天忙12个小时还觉得什么都没做成,问题恰恰出在努力这两个字上”,正文结构围绕“无效努力的特征—为什么停不下来—怎么跳出”展开,结尾引导成“评论区告诉我,你最近在忙什么”。这样的大纲,拿回来稍微改改就能开拍。
3.2 模板B:剧情/探店/生活Vlog类的大纲生成器
不是所有短视频都是对着镜头讲,剧情类、探店类、生活记录类的账号,逻辑和口播类完全不同。这类视频更看重“事件冲突”和“画面顺序”,所以我准备了第二套模板。
# 角色 你是一位擅长剧情类短视频导演,熟悉冲突、反转和悬念的设置,拍过探店、日常记录和轻剧情内容,知道怎么用画面讲故事而不是用旁白说明。 # 任务 围绕【一句话描述事件,比如:去一家评分4.9但门口排长队的小店】写一份【时长:90秒】的短视频脚本大纲。 # 内容源 - 我的账号定位:【比如:记录周末探店和城市生活的小众角落】 - 本期核心看点:【比如:这家店到底值不值得排队】 - 可拍摄素材:【写你手里有哪些素材,比如:排队场景、店里的招牌菜特写、老板的一段话】 # 风格要求 - 用画面讲故事,尽量不使用旁白和解说词。 - 对白要短,每句不超过10个字。 - 节奏紧,不在环境空镜上浪费超过3秒。 # 输出格式 按“起因—冲突—反转—结尾互动”四段结构输出: 1. 起因:交代场景和人物关系,用一两句话说明白。 2. 冲突:设置一个能引发评论欲望的矛盾点,比如价格贵、排队久、期望和现实有落差。 3. 反转:结尾出现意料之外但情理之中的结果。 4. 结尾互动:用一句不尬的话引导评论区讨论。 每一段都要写清: - 场景描述(一句话) - 画面内容(具体动作和机位,只用手机手持拍摄) - 对白或音效(如有) - 时长占比(例如起因占10%,冲突占40%,反转占35%,结尾占15%) # 约束 - 不上价值,不强行煽情,所有冲突必须基于生活常识。 - 全片场景不超过3个,避免频繁转场导致拍摄量过大。 - 不出现专业术语,不用宣传片风格的字幕。这套模板和模板A最大的区别是:它要求“四段结构”,还把“时长占比”单独提出来。因为剧情和探店类视频的节奏感比文字更重要,起承转合必须明显,不然观众会觉得“看完了但不知道看了啥”。我实际用的时候,会提前把能拍的素材写进“内容源”里,AI就会优先基于现有素材设计脚本,而不是空想一些你根本拍不到的镜头。
4. 实操过程:从复制模板到拿到可拍的大纲
4.1 首次使用前,把6个变量填好
很多人复制了模板,随便替换两三个字就跑,生成结果不理想就开始骂AI。实际上,模板只是骨架,变量才是灵魂。我每次使用前会花五分钟做一次“变量确认”,确保这六个信息是清晰的。
第一是账号定位。不要写“职场账号”,要写“面向毕业1到3年职场新人的成长干货号,内容偏向沟通表达和向上管理”。第二是本期选题。用一句话说清这条视频想讲什么,越具体越好。“怎么跟领导汇报”就比“职场沟通”好。第三是目标受众。受众越具体,AI的措辞就越精准。第四是核心观点。这条视频最想让观众记住的那句话,自己先想出来,AI才能围绕它搭结构。第五是视频时长。60秒、90秒、3分钟,结构复杂度完全不同。第六是可用素材。比如你手里有一段采访、一个案例、一组数据,把这些喂给AI,它能更好安排素材位置。
如果AI不了解你的账号风格,可以在对话里先发一段“账号说明书”:“我的账号叫某名,近一个月发布的内容集中在某方向,平均播放量多少,观众画像大概是某类人。希望接下来的脚本都贴合这个定位。”这段说明相当于给AI建立上下文,效果比每次临时解释好很多。
4.2 生成后不要急着拍,先用三步审核法过一遍
AI生成大纲之后,我一般不会直接拿去拍摄,而是用三步审核法检查一遍,很快,最多两分钟。
第一步看开头三秒钩子是否具体。合格的钩子应该包含一个具体画面或一句带冲突的话,比如“如果你每天忙12小时却什么都没做成,问题出在努力这两个字上”;不合格的钩子是“今天跟大家聊聊努力这件小事”。第二步看逻辑线是否顺畅。把大纲里的每个分点连起来读一遍,如果中间缺了必要的过渡,或者前后观点不一致,就得让AI补一段衔接。第三步看拍摄可行性。每一条分镜,在脑子里过一遍现场拍摄场景,确认真的能用手机拍出来。如果出现“航拍镜头”“无人机视角”“穿越机第一视角”这类画面,直接删掉或改成普通手持拍摄。
我还会顺便算一下时长匹配。口播文案按正常语速,一分钟大概能说240到280个字,如果AI给的口播文案超过300字,基本会超时,需要压缩。画面部分也一样,一个镜头按3到5秒算,60秒视频大概是12到20个镜头,如果一个大纲里列了30个分镜,那拍摄量就太大了,不适合日更创作者。
4.3 让AI迭代的第二轮、第三轮怎么提
AI生成的大纲很少能一次到位,迭代很正常。迭代不是从头再写,而是“基于当前版本做局部修改”。我会用类似这样的指令:“保持整体结构不变,把开场钩子换成冲突感更强的版本,多给3个备选”。
常见的迭代指令包括:把开场换成“反常识结论式”,把其中一个分论点改成“生活案例式”,把结尾互动改成“点名某类人”,把全文口播文案压缩20%,把某个段落改成更口语化的表达。每次只提一个方向,不要同时改五个地方,AI会顾此失彼。
我的经验是,一个提示词来回迭代不要超过三轮。超过三轮还不对,大概率是初始设定里信息不够,这时候新建对话,重新写一份更详细的提示词,效果反而比一直跟AI较劲好。还有一个细节:对话变长以后,AI会忘记最开始的要求,如果发现它开始“自由发挥”,马上开新对话,把原模板再贴一遍,不要犹豫。
5. 常见问题速查:提示词翻车现场与补救方法
5.1 五个高频问题和对应的补丁提示词
用提示词时间长了,你会发现翻车场景就那么几种,每个都有对应的“补丁”。下面这套是我自己整理的问题速查表,给提示词加上补丁,效果立竿见影。
| 问题 | 原因 | 补丁提示词 |
|---|---|---|
| 生成内容像官方通稿 | 风格约束不到位 | 加入“把每一句话都换成生活场景里的口语表达,禁止使用书面连接词,像在跟朋友解释一件事” |
| 开场钩子不够强 | 没有强调前三秒 | 加入“前三秒必须出现一个让观众停下来的理由:反常识结论、直接冲突或点名某类人” |
| 分镜没法拍 | 缺少设备约束 | 加入“所有分镜拍摄设备仅为一台手机和普通稳定器,不使用无人机、滑轨、特效和复杂运镜” |
| 口播文案太长 | 没限制字数 | 明确要求“全片口播文案控制在250字以内,每段画面说明不超过一行” |
| AI自己编造数据 | 没限制事实来源 | 加入“不得编造数据、专家名言和真实案例;如需数据,请标记为待核实,由我补充” |
这些补丁不是让你每次都把5条全加上。根据问题,加对应的一条就够了。另外我也习惯在模板末尾加一句“你输出的是完成稿,不要给建议,不要反问,不要问我是否满意”,这句话能砍掉AI一大堆“这个版本仅供参考”的废话,生成的结果更像可以直接交付的草稿。
5.2 把提示词沉淀成自己的“选题弹药库”
我发现很多创作者用AI是临时抱佛脚:今天想到一个选题,粘贴一个通用提示词,跑出来不满意,又重来。这样效率很低。正确做法是把提示词模板按账号分类沉淀成自己的“弹药库”,每次只改变量,不重写框架。
我自己的习惯是在笔记软件里建一个提示词库,分三类存放。第一类是“口播通用模板”,适用于知识分享和观点输出;第二类是“真人出镜叙事模板”,适用于有故事线的个人经历分享;第三类是“场景体验模板”,适用于探店、开箱、旅游记录。每个模板后面,我会记录最近一次使用时的实际效果,比如“这次生成的钩子不错,但是结尾有点尬”,下次用的时候就知道改哪里。
选题弹药库还可以跟“批量生产”结合起来。比如我准备做一个“职场沟通”系列,有10个选题,我会在一个对话里,把同一个模板复制10次,把每个选题替换进去,让AI一次性批量生成10份大纲。批量生成的代价是质量可能略低于单条精调,但胜在效率高,适合先用数量判断选题潜力。选中几个好题材,再单开对话精调。
我还会把用过的好提示词保存成“版本”。每次对模板做了有效修改,就存一个新版本,写明白“加了设备约束”“限制了字数”“改用了四段结构”。用的时间越长,这套弹药库就越顺手,到后面基本是五分钟出一个大纲。短视频行业最缺的就是稳定产出,这套方法能帮你把创作的不确定性降下来。
6. 最后说点我的实际体会
工具用得越久,我越觉得提示词工程本质上不是“怎么哄AI说话”,而是“怎么逼自己把需求想清楚”。很多时候跟AI说不清楚,是因为自己还没想清楚账号到底服务谁、这条视频到底要什么结果、观众看完为什么愿意互动。AI只不过是把这些问题摆到台面上,逼你回答而已。
所以我的习惯是,AI生成的大纲只作为起点,最后定稿一定是我自己改过的。AI负责给你几个可走的路径,但哪条路适合你的账号风格、你的表达能力、你的受众口味,这个判断只能由人来完成。这也是我不建议完全照搬AI脚本的原因——你可以照搬结构,但口气要换成自己的,案例要换回自己的,观点要捏成自己的。
最后再分享一个实用方法:把提示词当成一个需要持续维护的工具。今天觉得AI写得不够口语化,就往模板里加一条约束;下周发现它总是超时,就补一个字数限制。每做一次调整,你就拥有一份更好用的模板。三个月后回头看,你会发现稳定产出内容的瓶颈根本不在灵感,而在你有没有一套能用、好改、可复用的工作流程。工具越顺手,越考验你的判断力——这反而是一件好事,因为最终决定一条视频能不能火的,还是藏在你脑子里的那些认知和阅历。