AI片场AI 视频工作流指南 免费注册体验
环节教学 · 图生视频

图生视频怎么做?
先让起点变得确定

图生视频(Image-to-Video)的起点是一张已经确定的图, 模型不必再猜「画面长什么样」,只需要回答一件事:接下来该怎么动。 这就是它比文生视频可控的原因。本文按选图、写提示词、设置运动、生成、挑选 五步拆解完整流程,讲清提示词怎么写、常见失败怎么排查, 以及它在「分镜 → 画面 → 视频」这条链路里的位置。

最后更新 2026-09-26 含 6 条常见问题 只讲方法,不假设某个平台的按钮

先给结论

图生视频的上限,在你选图的那一刻就已经定了一半。

它只负责补运动,不负责重新设计画面 —— 所以「图选得对不对、动作写得多大」 比「用哪个模型」更影响结果。这篇文章的重点也放在这里: 先把起点选对,再用小步迭代的方式让它动起来。 想要一镜到底、想要大幅改画面的人,用它只会更费劲。

为什么图生视频比文生视频可控

原因只有一句话:起点是确定的。 文生视频里,模型要同时决定两件事 —— 画面长什么样、以及它怎么动; 图生视频里,第一件事已经被那张图定死了,模型只需要处理第二件。

这带来三个很实际的好处:

画面可以被事先确认

构图、色彩、人物长相在生成视频之前就已经看得见。不满意就换图,不用等生成完才发现不对。

角色能跨镜头保持一致

同一个角色的所有镜头都从同一套形象出发,脸和衣服才不会每个镜头换一次 —— 这是系列内容的前提。

返工范围小

结果不好时,你能判断是「图的问题」还是「动作的问题」,改一处再试,而不是整段重新碰运气。

把这句话记住就够了:图生视频不是「更简单的文生视频」, 它是把创造力前移到了画面阶段,视频阶段只负责让画面动起来。 这也意味着 —— 画关键帧的那一步偷懒,这里一定会还回来。

完整流程:五步

顺序很重要。新手常见的做法是拿到一张图就直接点生成, 来回几次都不满意之后才开始改提示词 —— 而问题往往出在第一步的图上。

第一步:选图(决定上限的一步)

优先选主体清晰、占比够大、边缘干净的图。 人物太小、画面太糊、细节过密(密集文字、细碎纹理)都会让模型无从下手。 另外要提前想好:这张图里哪些东西是不该动的 —— 动得越多,越容易崩。

第二步:写提示词(只写「怎么动」)

不要重复描述画面里已经有的东西。写清主体做什么、镜头怎么动、环境有什么变化, 一个镜头只安排一个主要动作。写得越克制,模型越容易做对;一口气写三四个动作,它通常一个都做不好。

第三步:确认运动相关的控制项

不少平台会提供额外的控制项,比如运动幅度、镜头方向,或者用首帧与尾帧来约束结果。 这些能力是否存在、叫什么名字、怎么用,各家不同,以官方说明为准 —— 本文只讲方法,不替你假设某个平台有哪些按钮。

第四步:生成,一次只改一个变量

同一张图、同一段提示词,多生成几条,先看结果的波动范围有多大。 要调整时,一次只改一处(只改动作、或只改幅度),否则你无法知道是哪一处起了作用。

第五步:挑选与归档

挑的不只是「好看的那条」,而是能和前后镜头接上的那条。 把可用的、以及被否掉的都留在画布上,并记下为什么否掉 —— 下一次做同类镜头,这份记录就是省下来的时间。

一个经验顺序:先让主体做小动作(转头、抬眼), 成功之后再加大动作(起身、走动),最后才考虑让镜头一起运动。 反过来做,失败率会明显变高,而且很难判断是哪一环出的问题。

一致性的来源

跨镜头不换脸,靠的是「用同一套图」

很多人以为角色一致性是提示词技巧,其实不是。 它的本质是:同一个角色的每个镜头,都从同一份形象资产出发, 而不是每次重新用文字描述一遍「这个人长什么样」。

这也解释了为什么画布式的工作流会强调资产沉淀 —— 角色形象被存下来,被多个镜头引用,改一次全线生效。 在散落的单次生成里,这件事没有地方发生。

  • 先把角色形象定下来 —— 定到你自己能一眼认出是同一个人
  • 所有镜头共用这一份 —— 而不是每个镜头各自描述一遍
  • 要改就改这一份 —— 改完所有引用它的镜头一起变

→ 这套做法怎么落到流程里:AI 视频工作流怎么搭。

提示词怎么写:只描述变化

图生视频的提示词和文生视频不一样。文生视频里,你不写,画面就没有; 图生视频里,画面已经有了,你要写的是「接下来发生什么」。 写错方向的典型症状是:把画面里的东西又描述了一遍,结果模型以为你要重建整个场景。

四条基本原则

  • 只写变化,不写已有的。人物长相、穿着、场景不用重复描述 —— 那是图已经交代过的信息。
  • 一个镜头一个动作。把「主体做什么」和「镜头怎么动」分开写,不要在一句话里塞三件事。
  • 动词优先于形容词。不写「很有电影感」,写「镜头缓慢向前推进」;不写「很唯美」,写「水痕顺着玻璃往下流」。
  • 写成别人能照着拍的句子。检验标准很简单:如果换个人拿这句话去拍,他知道该拍什么吗?
写哪一层写什么写砸了会怎样
主体动作谁做了什么,幅度多大(先写这一层)动作太大或在做几件事,人物容易变形
镜头运动镜头怎么动,或者明确不动不写清楚,模型可能自己乱动镜头,画面跟着漂
环境变化风、雨、光线、烟雾等随时间的变化写太多新元素,模型会尝试重建场景
保持项哪些东西不能变(用日常语言写清)不写,人物的脸和衣服就可能在几秒内变样
这是一套通用的写法分层,不涉及任何具体平台的参数名称。各平台实际支持哪些控制方式、如何填写,以官方说明为准。

一个可以直接照做的例子。假设原图是一个女孩站在雨夜的窗前。 不要写「一个漂亮的女孩站在雨夜的窗前,很唯美,电影感,超清」—— 这些图里都有。改成写变化:
「镜头缓慢向前推进;女孩微微抬眼看向窗外,睫毛轻动;雨点打在玻璃上,水痕向下流; 人物长相与穿着保持不变。」
每一句都是能被看见的变化,没有一句在重复画面里已有的信息。

常见失败原因与排查

下面这张表按「症状 → 常见原因 → 先查什么」来组织。 排查的关键是一次只改一个变量:同时换图又改提示词,你永远不知道是哪一步起的作用。

症状常见原因先查什么
人物变形、脸崩了人物在画面里太小或太糊;动作幅度给得太大换一张主体更清晰、占比更大的图;再把动作写小
画面几乎不动提示词里没有明确的动作;原图本身缺少可动的元素把动作写成动词;或者改成让镜头动,而不是让主体动
镜头抖、画面闪烁逐帧不稳定;画面里高频细节过多减少密集文字与细碎纹理;把时长缩短
多出一个人或一只手模型对画面里有几个人理解错了换一张主体明确、没有容易被误判元素的图;把人数写进保持项
背景漂移、场景换了提示词里写了画面中原本没有的元素删掉新增元素,只保留「怎么动」的描述
两次结果差很多生成本身带有随机性,这是正常现象图与提示词都固定住,只改一处再对比,看波动范围
结果像图片平移只有位移,没有表演或镜头语言拆成两个镜头:一条动主体,一条动镜头,再剪在一起
同一症状可能有多种原因,这张表给的是排查顺序,不是唯一答案。不同平台对同一类问题的表现也会不同,具体能力以官方说明为准。

如果反复失败,先退一步:换图,而不是换模型。 图生视频的结果很大程度上由起点决定 —— 一张主体小、细节碎、构图松的图, 交给哪个模型都很难稳定。先解决图的问题,再谈别的。

什么情况别用它

它虽然可控,但不是适用所有场景。下面这些情况,用它只会绕远路:

这些情况换别的方式

  • 手头一张可用画面都没有 —— 先用文生视频找方向,或者先把图做出来
  • 要大改画面内容(换场景、换人、换服装)—— 那是重画,不是让它动
  • 要一镜到底的长镜头 —— 拆成几段短镜头再拼,成功率更高
  • 画面里必须有精确的文字或标识 —— 几秒之内很容易被弄糊,实测一遍再决定
  • 要精确的口型对白 —— 属于另一类能力,是否存在、怎么用,以官方说明为准
  • 只是想快速看个效果 —— 直接用一键生成更快,不必先做图

这些情况它很合适

  • 分镜已经画好,每一镜的画面有明确要求
  • 同一个角色要在多个镜头里出现,一致性是刚需
  • 画面里要出现具体产品或指定造型,不能靠文字碰运气
  • 需要按同一套结构反复出片,流程要能复用
  • 客户或导演已经确认过某一版画面,不能重新生成

它在「分镜 → 画面 → 视频」里的位置

把它放回整条流水线上看,位置就很清楚了:上游是分镜和关键帧画面, 下游是配音、音效与剪辑。它承上启下 —— 图不行,这一步做不出好东西; 这一步出的视频不稳,后面剪辑也救不回来。

  • 1剧本故事与台词定下来
  • 2分镜拆成一个个镜头
  • 3关键帧画面每镜先出一张确定的图
  • 4图生视频让画面动起来
  • 5配音与音效声音对上画面
  • 6剪辑成片按节奏拼成整条

注意第 3 步和第 4 步的关系:第 3 步决定了第 4 步的天花板。 这也是为什么成熟的流程会把功夫花在画面上 —— 而不是在视频阶段反复重生成。

别把它当成孤立的一步。图生视频只是链条中的一环, 它的输入质量由上游决定,产出价值由下游兑现。 想看整条链路怎么串起来:AI 视频工作流怎么搭。

工具从哪里来

按公开定位,现在的图生视频工具大致分三类:

画布式平台(如 LibTV)

图生视频是画布上的一个节点:上游接关键帧画面,下游接配音与剪辑。 LibTV 由哩布哩布 AI(LiblibAI)推出,2026 年 3 月 18 日上线, 官网 www.liblib.tv,网页端使用、无需下载,推荐 Chrome 或 Edge,目前没有独立桌面客户端; 核心形态是无限画布 + 节点工作流,接入 Seedance、Wan、MiniMax 等主流模型, 官方列出的独家能力包括剧本原创与改编、导演执导、角色造型室和创意片头, 另有 LibTV Agent、LibTV 3D-BOX 和 TV Show 社区。

生成按算力计费,可以免费注册体验,深度使用需要会员或算力包 —— 具体价格与免费额度以官网页面为准。

单段生成型产品

即梦、可灵、Vidu、海螺、Runway 等,按公开定位都提供图生视频这一类能力: 一张图进去、一段视频出来,上手快,适合单条镜头。

它们的具体功能、可用模型与价格以官方说明为准,本文不转述参数与数字。

开源与本地部署类

还有一类可以自己部署的模型,灵活性高,但对机器和动手能力有要求。 公开定位偏技术型创作者,具体能力与硬件要求以官方说明为准。

关于「免费」这件事

可以免费注册体验的不少,但「免费」通常指的是有额度的免费: 额度怎么算、生成时长与分辨率是否受限、产出能不能商用,各家规则不同。 这些数字随时会变,以官网页面为准 —— 本站不转述可能已经过期的额度。

常见问题

图生视频怎么做?

五步:选一张主体清晰、构图确定的图;写一段只描述「怎么动」的提示词;确认平台上可用的运动控制项;生成并对比多条;挑出可用的那一条进入剪辑。决定成败的通常不是点生成那一下,而是前两步 —— 图选错了、动作写大了,后面怎么调都很难救回来。

图生视频和文生视频哪个更好用?

看你要什么。要速度和可能性,用文生视频;要确定和一致,用图生视频。需要跨镜头保持同一个角色的项目,通常以图生视频为主,文生视频只用来做氛围镜头和空镜 —— 因为图生视频的起点是确定的,模型只需要补运动,不用同时决定画面长什么样。

图生视频提示词怎么写?

只写「变化」,不重复描述画面里已经有的东西。一个镜头只安排一个主要动作,动词优先于形容词,把结果写成能看见的画面(不写「很有氛围」,而写「雨点打在窗上,水痕往下流」)。画面里原本没有的元素不要写进去,否则模型会尝试重建整个场景。具体控制项的命名与用法各家不同,以官方说明为准。

图生视频为什么人物会变形?

常见原因有三个:原图里人物太小或太模糊,模型拿不到足够信息;动作幅度写得太大,几秒里要做完太多事;画面细节过于密集,模型的注意力被分掉了。排查顺序是先换一张主体更清晰、占比更大的图,再把动作写小,最后才考虑缩短时长。

图生视频工具有免费的吗?

有可以免费注册体验的,包括 LibTV 这类画布式平台和若干单段生成型产品。但「免费」通常是有额度的免费:额度怎么算、生成时长与分辨率是否受限、产出能不能商用,各家规则不同,具体以官网页面为准 —— 本站不转述可能已经变化的数字。

图生视频在一条片子里用在哪一步?

用在「关键帧画面」和「剪辑成片」之间。上游是分镜定下来之后画好的关键帧,下游是配音、音效和剪辑。它承上启下:图不行,这一步做不出好东西;这一步出的视频不稳,后面剪辑也救不回来。

先把画面定下来,再让它动

图生视频真正的价值不在于「省事」,而在于它把不确定的部分挪到了可以反复检查的那一步。画面能看、能改、能确认之后,视频阶段才是一门手艺,而不是碰运气。

先把第一条流程跑通,再谈效率

LibTV 用无限画布和节点工作流把关键帧、视频、音频、剪辑串在一起,改上游下游会跟着更新。网页端打开就能用,不用下载;价格与免费额度以官网页面为准。