图生视频的上限,在你选图的那一刻就已经定了一半。
它只负责补运动,不负责重新设计画面 —— 所以「图选得对不对、动作写得多大」 比「用哪个模型」更影响结果。这篇文章的重点也放在这里: 先把起点选对,再用小步迭代的方式让它动起来。 想要一镜到底、想要大幅改画面的人,用它只会更费劲。
为什么图生视频比文生视频可控
原因只有一句话:起点是确定的。 文生视频里,模型要同时决定两件事 —— 画面长什么样、以及它怎么动; 图生视频里,第一件事已经被那张图定死了,模型只需要处理第二件。
这带来三个很实际的好处:
画面可以被事先确认
构图、色彩、人物长相在生成视频之前就已经看得见。不满意就换图,不用等生成完才发现不对。
角色能跨镜头保持一致
同一个角色的所有镜头都从同一套形象出发,脸和衣服才不会每个镜头换一次 —— 这是系列内容的前提。
返工范围小
结果不好时,你能判断是「图的问题」还是「动作的问题」,改一处再试,而不是整段重新碰运气。
把这句话记住就够了:图生视频不是「更简单的文生视频」, 它是把创造力前移到了画面阶段,视频阶段只负责让画面动起来。 这也意味着 —— 画关键帧的那一步偷懒,这里一定会还回来。
完整流程:五步
顺序很重要。新手常见的做法是拿到一张图就直接点生成, 来回几次都不满意之后才开始改提示词 —— 而问题往往出在第一步的图上。
第一步:选图(决定上限的一步)
优先选主体清晰、占比够大、边缘干净的图。 人物太小、画面太糊、细节过密(密集文字、细碎纹理)都会让模型无从下手。 另外要提前想好:这张图里哪些东西是不该动的 —— 动得越多,越容易崩。
第二步:写提示词(只写「怎么动」)
不要重复描述画面里已经有的东西。写清主体做什么、镜头怎么动、环境有什么变化, 一个镜头只安排一个主要动作。写得越克制,模型越容易做对;一口气写三四个动作,它通常一个都做不好。
第三步:确认运动相关的控制项
不少平台会提供额外的控制项,比如运动幅度、镜头方向,或者用首帧与尾帧来约束结果。 这些能力是否存在、叫什么名字、怎么用,各家不同,以官方说明为准 —— 本文只讲方法,不替你假设某个平台有哪些按钮。
第四步:生成,一次只改一个变量
同一张图、同一段提示词,多生成几条,先看结果的波动范围有多大。 要调整时,一次只改一处(只改动作、或只改幅度),否则你无法知道是哪一处起了作用。
第五步:挑选与归档
挑的不只是「好看的那条」,而是能和前后镜头接上的那条。 把可用的、以及被否掉的都留在画布上,并记下为什么否掉 —— 下一次做同类镜头,这份记录就是省下来的时间。
一个经验顺序:先让主体做小动作(转头、抬眼), 成功之后再加大动作(起身、走动),最后才考虑让镜头一起运动。 反过来做,失败率会明显变高,而且很难判断是哪一环出的问题。
跨镜头不换脸,靠的是「用同一套图」
很多人以为角色一致性是提示词技巧,其实不是。 它的本质是:同一个角色的每个镜头,都从同一份形象资产出发, 而不是每次重新用文字描述一遍「这个人长什么样」。
这也解释了为什么画布式的工作流会强调资产沉淀 —— 角色形象被存下来,被多个镜头引用,改一次全线生效。 在散落的单次生成里,这件事没有地方发生。
- 先把角色形象定下来 —— 定到你自己能一眼认出是同一个人
- 所有镜头共用这一份 —— 而不是每个镜头各自描述一遍
- 要改就改这一份 —— 改完所有引用它的镜头一起变
→ 这套做法怎么落到流程里:AI 视频工作流怎么搭。
提示词怎么写:只描述变化
图生视频的提示词和文生视频不一样。文生视频里,你不写,画面就没有; 图生视频里,画面已经有了,你要写的是「接下来发生什么」。 写错方向的典型症状是:把画面里的东西又描述了一遍,结果模型以为你要重建整个场景。
四条基本原则
- 只写变化,不写已有的。人物长相、穿着、场景不用重复描述 —— 那是图已经交代过的信息。
- 一个镜头一个动作。把「主体做什么」和「镜头怎么动」分开写,不要在一句话里塞三件事。
- 动词优先于形容词。不写「很有电影感」,写「镜头缓慢向前推进」;不写「很唯美」,写「水痕顺着玻璃往下流」。
- 写成别人能照着拍的句子。检验标准很简单:如果换个人拿这句话去拍,他知道该拍什么吗?
| 写哪一层 | 写什么 | 写砸了会怎样 |
|---|---|---|
| 主体动作 | 谁做了什么,幅度多大(先写这一层) | 动作太大或在做几件事,人物容易变形 |
| 镜头运动 | 镜头怎么动,或者明确不动 | 不写清楚,模型可能自己乱动镜头,画面跟着漂 |
| 环境变化 | 风、雨、光线、烟雾等随时间的变化 | 写太多新元素,模型会尝试重建场景 |
| 保持项 | 哪些东西不能变(用日常语言写清) | 不写,人物的脸和衣服就可能在几秒内变样 |
一个可以直接照做的例子。假设原图是一个女孩站在雨夜的窗前。
不要写「一个漂亮的女孩站在雨夜的窗前,很唯美,电影感,超清」——
这些图里都有。改成写变化:
「镜头缓慢向前推进;女孩微微抬眼看向窗外,睫毛轻动;雨点打在玻璃上,水痕向下流;
人物长相与穿着保持不变。」
每一句都是能被看见的变化,没有一句在重复画面里已有的信息。
常见失败原因与排查
下面这张表按「症状 → 常见原因 → 先查什么」来组织。 排查的关键是一次只改一个变量:同时换图又改提示词,你永远不知道是哪一步起的作用。
| 症状 | 常见原因 | 先查什么 |
|---|---|---|
| 人物变形、脸崩了 | 人物在画面里太小或太糊;动作幅度给得太大 | 换一张主体更清晰、占比更大的图;再把动作写小 |
| 画面几乎不动 | 提示词里没有明确的动作;原图本身缺少可动的元素 | 把动作写成动词;或者改成让镜头动,而不是让主体动 |
| 镜头抖、画面闪烁 | 逐帧不稳定;画面里高频细节过多 | 减少密集文字与细碎纹理;把时长缩短 |
| 多出一个人或一只手 | 模型对画面里有几个人理解错了 | 换一张主体明确、没有容易被误判元素的图;把人数写进保持项 |
| 背景漂移、场景换了 | 提示词里写了画面中原本没有的元素 | 删掉新增元素,只保留「怎么动」的描述 |
| 两次结果差很多 | 生成本身带有随机性,这是正常现象 | 图与提示词都固定住,只改一处再对比,看波动范围 |
| 结果像图片平移 | 只有位移,没有表演或镜头语言 | 拆成两个镜头:一条动主体,一条动镜头,再剪在一起 |
如果反复失败,先退一步:换图,而不是换模型。 图生视频的结果很大程度上由起点决定 —— 一张主体小、细节碎、构图松的图, 交给哪个模型都很难稳定。先解决图的问题,再谈别的。
什么情况别用它
它虽然可控,但不是适用所有场景。下面这些情况,用它只会绕远路:
这些情况换别的方式
- 手头一张可用画面都没有 —— 先用文生视频找方向,或者先把图做出来
- 要大改画面内容(换场景、换人、换服装)—— 那是重画,不是让它动
- 要一镜到底的长镜头 —— 拆成几段短镜头再拼,成功率更高
- 画面里必须有精确的文字或标识 —— 几秒之内很容易被弄糊,实测一遍再决定
- 要精确的口型对白 —— 属于另一类能力,是否存在、怎么用,以官方说明为准
- 只是想快速看个效果 —— 直接用一键生成更快,不必先做图
这些情况它很合适
- 分镜已经画好,每一镜的画面有明确要求
- 同一个角色要在多个镜头里出现,一致性是刚需
- 画面里要出现具体产品或指定造型,不能靠文字碰运气
- 需要按同一套结构反复出片,流程要能复用
- 客户或导演已经确认过某一版画面,不能重新生成
它在「分镜 → 画面 → 视频」里的位置
把它放回整条流水线上看,位置就很清楚了:上游是分镜和关键帧画面, 下游是配音、音效与剪辑。它承上启下 —— 图不行,这一步做不出好东西; 这一步出的视频不稳,后面剪辑也救不回来。
- 1剧本故事与台词定下来
- 2分镜拆成一个个镜头
- 3关键帧画面每镜先出一张确定的图
- 4图生视频让画面动起来
- 5配音与音效声音对上画面
- 6剪辑成片按节奏拼成整条
注意第 3 步和第 4 步的关系:第 3 步决定了第 4 步的天花板。 这也是为什么成熟的流程会把功夫花在画面上 —— 而不是在视频阶段反复重生成。
别把它当成孤立的一步。图生视频只是链条中的一环, 它的输入质量由上游决定,产出价值由下游兑现。 想看整条链路怎么串起来:AI 视频工作流怎么搭。
工具从哪里来
按公开定位,现在的图生视频工具大致分三类:
画布式平台(如 LibTV)
图生视频是画布上的一个节点:上游接关键帧画面,下游接配音与剪辑。 LibTV 由哩布哩布 AI(LiblibAI)推出,2026 年 3 月 18 日上线, 官网 www.liblib.tv,网页端使用、无需下载,推荐 Chrome 或 Edge,目前没有独立桌面客户端; 核心形态是无限画布 + 节点工作流,接入 Seedance、Wan、MiniMax 等主流模型, 官方列出的独家能力包括剧本原创与改编、导演执导、角色造型室和创意片头, 另有 LibTV Agent、LibTV 3D-BOX 和 TV Show 社区。
生成按算力计费,可以免费注册体验,深度使用需要会员或算力包 —— 具体价格与免费额度以官网页面为准。
单段生成型产品
即梦、可灵、Vidu、海螺、Runway 等,按公开定位都提供图生视频这一类能力: 一张图进去、一段视频出来,上手快,适合单条镜头。
它们的具体功能、可用模型与价格以官方说明为准,本文不转述参数与数字。
开源与本地部署类
还有一类可以自己部署的模型,灵活性高,但对机器和动手能力有要求。 公开定位偏技术型创作者,具体能力与硬件要求以官方说明为准。
关于「免费」这件事
可以免费注册体验的不少,但「免费」通常指的是有额度的免费: 额度怎么算、生成时长与分辨率是否受限、产出能不能商用,各家规则不同。 这些数字随时会变,以官网页面为准 —— 本站不转述可能已经过期的额度。
常见问题
图生视频怎么做?
五步:选一张主体清晰、构图确定的图;写一段只描述「怎么动」的提示词;确认平台上可用的运动控制项;生成并对比多条;挑出可用的那一条进入剪辑。决定成败的通常不是点生成那一下,而是前两步 —— 图选错了、动作写大了,后面怎么调都很难救回来。
图生视频和文生视频哪个更好用?
看你要什么。要速度和可能性,用文生视频;要确定和一致,用图生视频。需要跨镜头保持同一个角色的项目,通常以图生视频为主,文生视频只用来做氛围镜头和空镜 —— 因为图生视频的起点是确定的,模型只需要补运动,不用同时决定画面长什么样。
图生视频提示词怎么写?
只写「变化」,不重复描述画面里已经有的东西。一个镜头只安排一个主要动作,动词优先于形容词,把结果写成能看见的画面(不写「很有氛围」,而写「雨点打在窗上,水痕往下流」)。画面里原本没有的元素不要写进去,否则模型会尝试重建整个场景。具体控制项的命名与用法各家不同,以官方说明为准。
图生视频为什么人物会变形?
常见原因有三个:原图里人物太小或太模糊,模型拿不到足够信息;动作幅度写得太大,几秒里要做完太多事;画面细节过于密集,模型的注意力被分掉了。排查顺序是先换一张主体更清晰、占比更大的图,再把动作写小,最后才考虑缩短时长。
图生视频工具有免费的吗?
有可以免费注册体验的,包括 LibTV 这类画布式平台和若干单段生成型产品。但「免费」通常是有额度的免费:额度怎么算、生成时长与分辨率是否受限、产出能不能商用,各家规则不同,具体以官网页面为准 —— 本站不转述可能已经变化的数字。
图生视频在一条片子里用在哪一步?
用在「关键帧画面」和「剪辑成片」之间。上游是分镜定下来之后画好的关键帧,下游是配音、音效和剪辑。它承上启下:图不行,这一步做不出好东西;这一步出的视频不稳,后面剪辑也救不回来。
先把画面定下来,再让它动
图生视频真正的价值不在于「省事」,而在于它把不确定的部分挪到了可以反复检查的那一步。画面能看、能改、能确认之后,视频阶段才是一门手艺,而不是碰运气。
先把第一条流程跑通,再谈效率
LibTV 用无限画布和节点工作流把关键帧、视频、音频、剪辑串在一起,改上游下游会跟着更新。网页端打开就能用,不用下载;价格与免费额度以官网页面为准。