文生视频的强项是「无中生有」,弱项是「精确可控」。
它的起点只有文字,画面长什么样、怎么动,全由模型替你决定 —— 所以它适合找灵感、做氛围、铺素材,不适合要求跨镜头一致或精确构图的任务。 那些活儿应该交给图生视频:先把画面定下来,再让它动。 把这两件事分清楚,能省掉大量返工。
文生视频是什么意思
先给一个能直接检验的定义:
文生视频(Text-to-Video),指的是输入一段文字描述,由模型直接输出一段视频。 文字是全部的起点,画面内容与运动方式都由模型补全。
这里有两点容易被忽略:
- 「文字」的颗粒度可以差很多。一句话能生成,一段写清主体、动作、镜头、光线的提示词也能生成。写得越少,模型替你做的决定就越多。
- 输出的是画面,不是工程文件。你拿到的是一段视频,不是一个还能改图层、改参数、改节点的工程。想改,通常只能重新生成 —— 这一点直接决定了它的返工成本。
所以文生视频和文生图的关系,比很多人想的更近: 它多出来的那一个维度是「时间」,麻烦也几乎都出在时间上。 一张图好不好,你一眼就能判断;一段视频好不好,取决于每一帧都对、而且帧与帧之间连得上。
顺着技术路线看:它为什么不稳定
不必深究原理,但了解大致的路线变化,就能理解「为什么不稳定」这件事为什么到今天仍然存在。 大致可以分成三个阶段:
第一代:把视频当很多张图
每一帧独立生成,再按顺序排起来。单看某一帧还行,连起来就跳 —— 因为帧与帧之间谁也不知道对方画了什么。
第二代:给时间加一个模块
让前后帧互相参考,运动因此连贯了不少。但「连贯」不等于「合理」:物体还是会穿模,人物走两步就变形。
第三代:时空一起建模
把空间和时间当成一件事来算,整段一起生成而不是先画后拼。一致性和稳定性都更好,但「理解世界怎么运转」这一关仍然没有过。
这三代不是替代关系,今天的产品里常常混着用。但它们共同指向同一个事实: 模型并不知道下一秒「应该」发生什么,它只是在根据已有的内容推测接下来「可能」发生什么。 推测得越远,偏离越大 —— 这就是不稳定的根源。
这一条根源,解释了三个常见现象
- 为什么越长的镜头越容易崩。生成时间越长,推测的步数越多,误差累积得越明显。
- 为什么运动常常违背常识。模型学到的是「看起来像」的规律,不是物理定律,所以手会穿过物体、东西会凭空出现。
- 为什么同样的提示词每次结果都不同。推测本身带有随机性,它不是在检索一段固定的视频,而是在现编一段。
正确的用法是顺着它的特点来:让它做短、明确、只包含一件事的镜头, 把「长度」和「结构」交给流程去拼。一条 60 秒的片子,做成若干个几秒的镜头再串起来, 比指望一次生成一整段要现实得多。
文生视频、图生视频、视频生视频的区别
这三类经常被混着叫,其实差别只在起点是什么, 但起点决定了后面所有事情:模型要替你决定多少、结果有多可控、失败之后怎么救。
| 对比维度 | 文生视频 | 图生视频 | 视频生视频 |
|---|---|---|---|
| 起点(输入) | 一段文字 | 一张确定的图 + 文字 | 一段已有的视频 + 文字 |
| 起点确定性 | 低,画面由模型决定 | 高,构图与主体已定 | 高,运动与构图都已定 |
| 模型要决定什么 | 画面 + 运动,全都要 | 主要决定怎么动 | 主要决定怎么改 |
| 可控程度 | 低,靠提示词反复试 | 中高,改了图就能改结果 | 中高,改的是风格与细节 |
| 提示词的作用 | 决定一切 | 描述运动与变化 | 描述要改成什么样 |
| 典型失败 | 整体跑偏、前后不像一个人 | 人物变形、动作不受控 | 画面闪烁、细节糊掉 |
| 返工成本 | 高,通常整段重生成 | 中,可以换图重来 | 中,可以调描述重来 |
| 适合的活儿 | 找灵感、氛围镜头、空镜 | 分镜已定的镜头、角色镜头 | 改风格、做转场、修素材 |
一句话概括:起点越确定,结果越可控。 文生视频把「画什么」和「怎么动」两件事一起交给模型, 图生视频只把「怎么动」交给模型,视频生视频连「怎么动」都已经定好了。
→ 想看图生视频的完整流程和提示词写法:图生视频怎么做。
为什么「一句话出片」听起来诱人,做起来却很难
文字是信息密度很低的输入。一句话里没写的部分 —— 人物穿什么、镜头怎么摆、光从哪来 —— 模型都要自己补。补得对不对,只能靠多生成几次去碰。
图片不一样:它本身就把构图、色彩、人物长相固定住了。 模型只需要回答一个问题:接下来该怎么动。 任务从「猜一个世界」变成了「补一段时间」,难度不在一个量级。
- 要的是速度和可能性 —— 用文生视频,多跑几条挑一条
- 要的是确定和一致 —— 先把图定住,再用图生视频
什么任务适合文生视频,什么任务该用图生视频
这一节可以直接当判断清单用。选错了方式,后面所有的返工都是这时候埋下的。
这些任务适合文生视频
- 找灵感、试风格:还不知道要什么感觉,先快速看几种可能性
- 现实里拍不到的抽象画面:概念场景、想象空间、超现实氛围
- 氛围镜头与空镜:云、雨、城市夜景这类不需要精确构图的画面
- 转场与填充镜头:整条片子里起连接作用的那几秒
- 铺素材库:按同一套描述批量生成,之后慢慢挑
- 只有文字没有参考图的时候:手头拿不出任何可用的起始图
这些任务该换成图生视频
- 同一个角色要在多个镜头里出现 —— 用文字描述长相,每次都长不一样
- 分镜已经画好了,画面有明确要求 —— 与其用文字重新描述一遍,不如直接拿图当起点
- 画面里要出现具体的产品、真实人物或指定文字
- 需要精确控制镜头往哪边运动、主体在画面什么位置
- 客户或导演已经确认过某一版画面,不能重新碰运气
一个常见的错误顺序:先花大量时间用文字反复生成, 好不容易碰出一张满意的,再把它拿去图生视频 —— 这等于绕了一圈回到起点。 正确顺序通常是反过来的:先确定画面,再让它动。 只有当画面本身还不确定时,文生视频才是更前面的一步。
主流模型盘点:先归类,再谈选择
这一节只做归类,不比较参数与价格。视频模型迭代很快, 任何写死在页面上的版本号和数字都可能已经过期,所以下面只说明每个名字属于哪一类、 以及它在一条流程里大概扮演什么角色。
| 名称 | 属于哪一类 | 在流程里怎么用得上 |
|---|---|---|
| Seedance | 视频生成模型 | 被创作平台接入的一类主流视频生成模型,LibTV 公开信息里列出的接入模型之一;可作为工作流里的生成节点,具体能力与可用范围以官方说明为准 |
| Wan | 视频生成模型 | 同上,属于被平台接入的模型;具体版本与能力以官方说明为准 |
| MiniMax | 模型厂商旗下的生成模型 | 同样是 LibTV 公开列出的接入模型之一;具体能力以官方说明为准 |
| 可灵 | 面向创作者的 AI 视频生成产品 | 按公开定位提供文生视频、图生视频等生成能力;参数与价格以官方说明为准 |
| 即梦 | 面向创作者的 AI 创作产品 | 按公开定位包含图像与视频生成能力;具体功能以官方说明为准 |
| Vidu | AI 视频生成产品 | 按公开定位提供文生视频、图生视频等能力;具体以官方说明为准 |
| 海螺 | AI 视频生成产品 | 按公开定位提供视频生成能力;具体以官方说明为准 |
| Runway | AI 视频创作工具集 | 按公开定位包含多种视频生成与编辑能力;具体以官方说明为准 |
那「文生视频大模型」这个词指什么
它指的是生成式大模型里专门处理「文字到视频」这个任务的分支,通常由几部分配合完成: 理解文字的模块、负责生成画面的模块,以及让帧与帧之间连贯的时序模块。 不同产品的组合方式不一样,所以同样叫文生视频,擅长的镜头类型可能完全不同。 具体架构与能力以官方说明为准。
选工具时更该问的问题:不是「哪个模型更强」,而是 「我的这条片子需要几种镜头?这些镜头分别适合谁来生成?换模型的成本有多高?」 在一张画布上,换模型只是换一个节点;在一键式工具里,换模型往往意味着换一个网站重新开始。
在工作流里,它处在哪一环
按工作流的五层来看(素材、决策、生成、编排、输出), 文生视频属于生成层 —— 它负责把决策变成画面,既不负责决策,也不负责编排。
更准确的位置是:它更像「填空」,而不是「打底」。
- 打底的是关键帧画面。先确定这一镜长什么样(通常是先出一张图),再让它动起来 —— 这一步交给图生视频。
- 文生视频常被用来做:概念草图、氛围镜头、转场与空镜,以及手头没有参考图时的第一版画面。
- 它在流程里的价值是「打开可能性」,而不是「守住一致性」。一致性要靠资产沉淀,那是画布和节点负责的事。
一句话判断:这一镜的画面需不需要被精确确定?
需要,就先用图把它定住,再图生视频;不需要,就直接文生视频,快。
→ 想看流程整体怎么搭:AI 视频工作流怎么搭。
常见问题
文生视频是什么意思?
文生视频(Text-to-Video)指的是:输入一段文字描述,由模型直接输出一段视频。这里的文字可以是一句话,也可以是一段写清镜头、动作、光线与氛围的提示词;输出的是一段有时长的画面序列,不是一个还能继续改图层、改参数的工程文件。
文生视频和图生视频有什么区别?
图生视频的起点是一张已经确定的图,模型主要负责补运动;文生视频的起点是文字,模型要同时决定画面长什么样和怎么动。起点越确定,结果越可控 —— 所以需要跨镜头一致、需要精确构图的任务,通常更适合从图出发。
文生视频为什么不稳定?
因为模型并不像人那样「记住」上一秒发生了什么,它是根据已有的画面继续往下推测。推测得越远,偏离越多:人物会变形、物理会出错、镜头会漂。理解这一点,就不会期待它一次生成很长的镜头 —— 长镜头要拆成多个短镜头再拼。
文生视频大模型是什么?
文生视频大模型是生成式大模型里专门处理「文字到视频」这一类任务的分支,通常由几部分配合完成:理解文字的模块、负责生成画面的模块,以及让帧与帧之间连贯的时序模块。不同产品的组合方式不一样,具体架构与能力以官方说明为准。
文生视频提示词要怎么写?
可以按四层来写:主体(谁、长什么样)、动作(做什么,一个镜头只安排一件事)、镜头(景别与运动方式)、环境(光线、天气、氛围)。写不清楚的地方,模型会自己替你决定,所以宁可短而具体,不要长而含糊。写完之后先看一遍:哪一句是可有可无的,删掉它。
文生视频工具怎么选?
先分清楚你要的是「生成一段视频」还是「做出一整条片子」。只要前者,选一个自己顺手的一键生成工具就够;要做整条片子,就要看它能不能被接进工作流、能不能和角色资产配合。各平台的模型、价格与免费额度以官方说明为准。
把「碰运气」换成「定下来」
文生视频负责打开可能性,图生视频负责把它固定住。一条片子能顺利做完,靠的通常不是哪一次生成特别成功,而是每一步的起点都足够确定 —— 这也是工作流存在的理由。
与其反复碰运气,不如把它们放进一条流程
LibTV 用无限画布和节点把剧本、分镜、画面、视频、音频串在一起,接入的模型可以按镜头挑。网页端打开就能用,不用下载;价格与免费额度以官网页面为准。