AI 视频提示词怎么写?
先补上运动与时间这两段
很多人写视频提示词,用的还是写图像提示词的习惯:把画面里有什么、长什么样描述清楚,然后发现生成的画面「很死」。 问题不在词不够多 —— 视频比图像多了两个维度:画面里什么在动、这段时间里画面怎么变化。 这篇给一套可复用的结构,以及五种常见的写法错误。
约 4800 字 含六段式结构表 最后更新 2026-09-26
视频提示词和图像提示词的差别只有一个:要不要写运动和时间的描述。
把一段提示词固定成「主体 → 动作 → 镜头 → 光线 → 风格 → 节奏」六段来写, 比堆形容词有效得多。写不好的原因通常不是词太少,而是把互相冲突的指令塞进了同一句话。
视频提示词和图像提示词,差在「运动」和「时间」
图像提示词描述的是一个静止的瞬间:谁、在哪里、长什么样、什么光。 这套写法直接搬到视频生成里,常见的反馈是「画面很漂亮,但是很死」—— 因为视频还要多回答两个问题:
- 运动 —— 画面里什么在动、往哪个方向动、动多快、幅度多大。包括主体的动作,也包括镜头本身的移动。
- 时间 —— 这段画面对应多长时间、里面发生几件事。一次生成能承载的事件量是有限的,超出的部分模型只能自己取舍。
| 对比项 | 图像提示词 | 视频提示词 |
|---|---|---|
| 描述对象 | 一个瞬间 | 一小段时间 |
| 要不要写动作 | 可写可不写,多为静态姿势 | 必须写,且要带方向、幅度、速度 |
| 要不要写时间 | 不存在这个概念 | 要控制在一件事之内,不能跨越多个事件 |
| 要不要写镜头 | 通常只写构图与角度 | 要写,因为镜头本身也会动 |
| 典型失败 | 构图不对、风格不对 | 画面在动,但看不懂在干什么 |
运动怎么写:方向 + 幅度 + 速度
运动的写法可以拆成三个可填的槽:往哪动(方向)、动多少(幅度)、动多快(速度)。 「她缓缓抬头」比「她很难过」有用,因为前者给出了一个能被执行的动作; 「头发被风持续吹向画面左侧」比「头发在飘」有用,因为它说清了方向和持续性。
时间怎么写:一次生成只放一件事
在描述里写「他先推开门,然后走到窗边,最后坐下」这类跨越多个事件的句子, 通常不会得到三个连续的动作,而是得到其中一个,或者得到一个把三件事糊在一起的怪画面。 比较稳的做法是把动作收成一个动作单元:从哪开始、经过什么、停在哪里。 需要多个事件,就用多个镜头去接,而不是塞进一次生成。
把「运动」写成形容词,是最常见的一类失败。 「动感的」「充满活力的」「有张力的」都不是动作 —— 模型没法把它们变成画面里正在发生的事, 只能按训练里最常见的关联去猜。把它们换成具体动作: 「镜头快速横向掠过」「雨点持续打在伞面上」「人物由远走近,占画面比例逐渐变大」。
一套可复用的提示词结构:六段式
把一段视频提示词拆成六段,每段只回答一个问题。顺序本身就是一种约束 —— 先定主体和动作,再定怎么拍、像什么,最后调节奏。
| 段落 | 它回答的问题 | 写什么 | 漏了会怎样 |
|---|---|---|---|
| ① 主体 | 画面里是谁、是什么 | 人物或物体的具体特征:年龄、穿着、状态、材质 | 画面里出现的东西每次都不一样,角色形象无法稳定 |
| ② 动作 | 正在发生什么 | 一个动作单元,带方向、幅度、速度 | 画面变成一张会呼吸的照片 |
| ③ 镜头 | 观众站在哪、镜头怎么拍 | 景别(远景 / 中景 / 特写)、机位角度、镜头是固定还是移动 | 构图随机,同一场戏的镜头接不上 |
| ④ 光线 | 光从哪来、什么色调 | 光源方向与性质(自然光 / 顶灯 / 霓虹)、冷暖倾向 | 画面偏平,前后镜头色调不统一 |
| ⑤ 风格 | 整体像什么 | 写实或动画、胶片或数码、饱和与质感倾向 | 每条片子像出自不同人之手 |
| ⑥ 节奏 | 快还是慢 | 动作的快慢、画面是否安静、有没有停顿感 | 该安静的地方很躁,该紧的地方拖沓 |
一个完整例子:六段逐一对上
下面是一段把六段都写全的描述(括号只是标注,实际使用时去掉括号连成一段):
「一位穿深色风衣的中年男人站在雨夜的便利店门口(主体), 他抬手把伞收拢,抬头看向招牌(动作), 镜头从他的侧后方缓慢推近到中景(镜头), 顶灯与霓虹在湿漉漉的地面上反光,画面以冷蓝为主(光线), 写实电影感,低饱和(风格), 动作缓慢,画面安静(节奏)。」
这段话里没有生僻词,也没有形容词堆砌,但它把「谁在做什么、怎么拍、看起来像什么」全部交代了。 换成图像提示词,第②段和第⑥段是可以整段删掉的 —— 这就是两者的分界线。
顺序可以调,但主体和动作要挨着。 这两段是模型的锚点:先让它知道画面里有谁,再让它知道这个人在干什么。 把风格和光线插在中间,容易让模型把注意力放在质感上,动作反而被忽略。
从一句话到成稿:四步写完一段提示词
这套顺序是为了避免「一上来就堆形容词」。新手跳过的通常是前两步,结果写出来的东西漂亮但不动。
第一步:先用一句话写下「谁在做什么」
不求好看,只求主谓宾齐全。「男人在便利店门口收伞」就够。 这句话写不出来,说明这个镜头你还没想清楚要拍什么,这时候换什么词都没用。
第二步:把动作补成「起—承—止」
从哪个状态开始、中间做了什么、停在哪个状态。「抬手 → 收拢 → 抬头看招牌」, 这就是一个动作单元。同时补上方向、幅度、速度,别留给模型去猜。
第三步:补镜头、光线、风格三段
这三段决定画面「看起来像什么」。镜头要写清景别与是否移动, 光线写清来源与冷暖,风格写清写实还是动画。同一场戏里,这三段的写法要尽量保持一致, 否则镜头之间会跳。
第四步:最后写节奏,并检查指令冲突
通读一遍,问三个问题:画面里谁在动、怎么动、镜头在做什么。 三个都答得上来说明写完了;再检查一遍有没有互相打架的指令(见下一节的错误四)。
五种常见的写法错误
下面这五条,是按出现频率排的。每条都写清「为什么这样写会失败」,因为只知道「不该这么写」是改不动的。
错误一:只堆名词,不写动作
整段都是「一个女人,长发,白衬衫,咖啡馆,暖光,胶片感」,唯独没说她在干什么。 为什么失败:模型能理解画面里有什么,但不知道该发生什么, 于是给你一张构图不错、但完全没有事件的照片式画面。视频生成的价值在「发生」, 不写动作等于主动放弃这部分。
错误二:把多个时间段塞进一次生成
「他推开门走进来,环顾一圈,然后坐到窗边点了一支烟」—— 这是四个事件。 为什么失败:一次生成通常只对应很短的一段时间, 事件数量超出承载能力时,模型会在中间随机取舍:要么只做第一个动作, 要么把几个动作快速糊在一起。你以为写的是分镜,实际得到的是一个跳帧的画面。
错误三:用抽象情绪词代替可执行动作
「悲伤的」「高级感的」「有电影味儿的」。 为什么失败:这些词只存在于人的主观判断里, 模型只能按训练数据里最常见的关联去猜 —— 十次生成给你十种答案,没法稳定复现, 也没法在同一场戏里保持一致。把情绪换成动作和外显细节: 「低头看着手里的杯子,手指停在杯沿上没有动」。情绪不是不能写, 而是要写成看得见的东西。
错误四:镜头指令互相打架
同一段里同时出现「固定机位」和「镜头快速环绕」, 或者「主体完全静止」和「画面剧烈运动」。 为什么失败:模型只能取舍其中一个,你以为是风格, 实际得到的是随机结果 —— 同一条提示词跑两次,出来的东西差别很大。 自查方法很笨但有效:把镜头相关的词挑出来看一遍,有没有表述相反的。
错误五:把某个平台的私有语法当成通用写法
在网上抄来一串带括号和符号的「公式」,换一个工具就完全失效。 为什么失败:不同平台对权重、参考图、专用运镜词的支持方式不一样, 这些写法属于平台自己的约定,不是通用语法。稳妥的做法是: 用通用的描述性语言写画面内容,平台特有的写法只在该平台的官方说明里学,不要凭教程硬套。
| 错误 | 典型写法 | 改写方向 |
|---|---|---|
| 只堆名词 | 「女人,长发,咖啡馆,暖光」 | 补上她正在做的那一件事 |
| 多事件塞一起 | 「先……然后……最后……」 | 拆成多个镜头,每次只拍一件事 |
| 抽象情绪词 | 「悲伤的」「高级感」 | 换成看得见的动作与细节 |
| 指令冲突 | 「固定机位 + 快速环绕」 | 删掉其中一个,只保留你要的那个 |
| 平台私有语法 | 照抄的符号与权重写法 | 改成通用描述,私有写法以官方说明为准 |
提示词反推是什么,什么时候值得用
提示词反推(也有人叫反推提示词、图片反推)是指让工具从一张已有的图片、 或一段已有的视频里,反过来生成一段描述文字。搜「ai视频提示词反推」的人, 多数是想知道它能不能省掉自己写提示词的功夫。答案是:能省一部分,但它不是模板生成器。
值得用的三种情况
- 拿到参考素材,想复刻它的质感。反推出来的光线与风格描述往往比自己想的准确, 可以只取这两段用在自己的画面上。
- 想学习别人怎么组织描述。把几张喜欢的画面分别反推一遍, 对比它们的描述顺序,比看教程更容易看出规律。
- 自己拍过的素材要接延伸镜头。先反推出现有画面的描述, 再在同样的光线与风格下写新的动作,前后更容易接得上。
别指望它的三种情况
- 想直接当模板用。反推结果描述的是那一张图那一段视频, 换主体、换场景之后必须重写,尤其是主体和动作两段。
- 想拿到节奏和镜头意图。反推偏向画面内容(有什么、什么颜色), 对「镜头为什么这么走」通常给不出有用信息,这部分要自己补。
- 想拿别人的素材商用。反推只是描述文字,不等于获得素材授权。 用别人的画面做商用内容前,先确认授权范围。
更实用的一个用法:别要「完整提示词」,要「结构」。 把参考画面按六段结构拆开,你保留它的镜头与光线写法,替换掉主体与动作。 这样得到的东西才是能反复用的,而不是一次性的描述。
什么时候不该靠提示词解决
提示词能解决的是单个镜头里的画面问题。下面这几件事, 提示词写得再好也解决不了 —— 它们不是描述问题,是流程问题:
- 跨镜头的角色一致性。第 3 个镜头和第 17 个镜头里的主角不是同一张脸, 因为每次都从零开始描述「这个人长什么样」。描述得再细,也复制不了上一次的随机结果。
- 镜头之间的衔接。每个镜头单独看都不错,接起来却不连贯 —— 因为镜头之间的关系没有被记录下来。
- 改一处不重做全片。台词改了一句,前面基于旧台词做的画面全部作废, 只能手工重来。提示词之间没有依赖关系。
- 按同一套模板批量出片。每次都要重新粘贴、重新改词, 流程本身没有被固化下来。
这些问题的解法是把剧本、角色、分镜、画面按依赖关系固定下来,让改上游、下游自动更新 —— 也就是工作流。这部分的完整做法见 AI 视频工作流怎么搭; 如果你卡在「一场戏里谁先说话、哪句是转折」这一层,那属于剧本问题, 见 AI 剧本创作怎么做。
另外,写得顺手的提示词不要每次重写。把验证过的那几段整理成可复用的模板, 下次只换主体和动作 —— 现成的分类模板见 AI 视频提示词模板库。
什么情况别用这套六段式: 如果你只是偶尔生成一段视频发社交平台,把六段全部写满反而更慢, 写清主体和动作就够了。这套结构是为「同一个项目要反复生成、要稳定复现」的人准备的 —— 一次性需求,不必上结构。
另外要有预期:生成要消耗算力,具体计费方式与免费额度以官网页面为准。 把提示词改到位再点生成,比反复试要省。
常见问题
AI 视频提示词怎么写才有效?
按「主体 → 动作 → 镜头 → 光线 → 风格 → 节奏」六段来写,每段回答一个问题。其中动作和节奏是视频特有的两段,图像提示词里没有。另外,一次生成只放一个动作单元,不要把多个时间段的事件塞进同一句话。
AI 视频提示词和图像提示词有什么差别?
图像提示词描述的是一个静止的瞬间,视频提示词还要多回答两件事:画面里什么在动、怎么动,以及这段时间里画面如何变化。同一段描述直接搬到视频生成里,常见的结果是画面很死,这不是模型不行,而是没有写运动和时间的部分。
提示词反推是什么意思?能直接当模板用吗?
提示词反推是指让工具从一张已有的图片或一段已有的视频反推出描述文字。它适合用来学习别人怎么组织描述,或者拿到参考素材后快速起一个草稿;但反推结果针对的是那一张图那一段视频,换主体、换场景后要重写,不能当模板直接套用。用别人的素材前,先确认授权。
提示词是不是写得越详细越好?
不是。描述越长,越容易出现互相冲突的指令,比如同时要求镜头快速推进和画面安静稳定,模型只能随机取舍。优先把主体、动作、镜头三件事说清楚,其余段落按需要添加。
提示词写好就能做出完整片子吗?
不能。提示词只能解决单个镜头的画面问题。跨镜头的角色一致性、镜头之间的衔接、改一处不重做全片,这些都不是提示词能解决的,需要把剧本、角色、分镜、画面按依赖关系固定下来,也就是工作流。
把提示词放进流程里,它才留得住
单条提示词跑一次就散了。注册后可以先拿官方模板跑通一条 15 秒的片子,看节点是怎么把剧本、分镜、角色和画面串起来的 —— 再决定要不要深入。