AI片场AI 视频工作流指南 免费注册体验
概念词典 · 文生视频

文生视频是什么?
它为什么总是不够稳

文生视频(Text-to-Video)说的是一件很直接的事: 输入一段文字,模型直接输出一段视频。 它和文生图的思路同源,但多了一个「时间」维度,麻烦也基本都出在这个维度上。 这篇文章讲清它的定义、三代技术路线为什么导致不稳定、 它和图生视频、视频生视频到底差在哪, 以及在工作流里它应该站在哪一环。

最后更新 2026-09-26 含 6 条常见问题 盘点只做归类,不比较参数

输入一段文字描述
输出一段有时长的画面
所在位置工作流里的生成层
主要风险越长越容易偏离
先给结论

文生视频的强项是「无中生有」,弱项是「精确可控」。

它的起点只有文字,画面长什么样、怎么动,全由模型替你决定 —— 所以它适合找灵感、做氛围、铺素材,不适合要求跨镜头一致或精确构图的任务。 那些活儿应该交给图生视频:先把画面定下来,再让它动。 把这两件事分清楚,能省掉大量返工。

文生视频是什么意思

先给一个能直接检验的定义:

文生视频(Text-to-Video),指的是输入一段文字描述,由模型直接输出一段视频。 文字是全部的起点,画面内容与运动方式都由模型补全。

这里有两点容易被忽略:

  • 「文字」的颗粒度可以差很多。一句话能生成,一段写清主体、动作、镜头、光线的提示词也能生成。写得越少,模型替你做的决定就越多。
  • 输出的是画面,不是工程文件。你拿到的是一段视频,不是一个还能改图层、改参数、改节点的工程。想改,通常只能重新生成 —— 这一点直接决定了它的返工成本。

所以文生视频和文生图的关系,比很多人想的更近: 它多出来的那一个维度是「时间」,麻烦也几乎都出在时间上。 一张图好不好,你一眼就能判断;一段视频好不好,取决于每一帧都对、而且帧与帧之间连得上。

顺着技术路线看:它为什么不稳定

不必深究原理,但了解大致的路线变化,就能理解「为什么不稳定」这件事为什么到今天仍然存在。 大致可以分成三个阶段:

第一代:把视频当很多张图

每一帧独立生成,再按顺序排起来。单看某一帧还行,连起来就跳 —— 因为帧与帧之间谁也不知道对方画了什么。

第二代:给时间加一个模块

让前后帧互相参考,运动因此连贯了不少。但「连贯」不等于「合理」:物体还是会穿模,人物走两步就变形。

第三代:时空一起建模

把空间和时间当成一件事来算,整段一起生成而不是先画后拼。一致性和稳定性都更好,但「理解世界怎么运转」这一关仍然没有过。

这三代不是替代关系,今天的产品里常常混着用。但它们共同指向同一个事实: 模型并不知道下一秒「应该」发生什么,它只是在根据已有的内容推测接下来「可能」发生什么。 推测得越远,偏离越大 —— 这就是不稳定的根源。

这一条根源,解释了三个常见现象

  • 为什么越长的镜头越容易崩。生成时间越长,推测的步数越多,误差累积得越明显。
  • 为什么运动常常违背常识。模型学到的是「看起来像」的规律,不是物理定律,所以手会穿过物体、东西会凭空出现。
  • 为什么同样的提示词每次结果都不同。推测本身带有随机性,它不是在检索一段固定的视频,而是在现编一段。

正确的用法是顺着它的特点来:让它做短、明确、只包含一件事的镜头, 把「长度」和「结构」交给流程去拼。一条 60 秒的片子,做成若干个几秒的镜头再串起来, 比指望一次生成一整段要现实得多。

文生视频、图生视频、视频生视频的区别

这三类经常被混着叫,其实差别只在起点是什么, 但起点决定了后面所有事情:模型要替你决定多少、结果有多可控、失败之后怎么救。

对比维度文生视频图生视频视频生视频
起点(输入)一段文字一张确定的图 + 文字一段已有的视频 + 文字
起点确定性低,画面由模型决定高,构图与主体已定高,运动与构图都已定
模型要决定什么画面 + 运动,全都要主要决定怎么动主要决定怎么改
可控程度低,靠提示词反复试中高,改了图就能改结果中高,改的是风格与细节
提示词的作用决定一切描述运动与变化描述要改成什么样
典型失败整体跑偏、前后不像一个人人物变形、动作不受控画面闪烁、细节糊掉
返工成本高,通常整段重生成中,可以换图重来中,可以调描述重来
适合的活儿找灵感、氛围镜头、空镜分镜已定的镜头、角色镜头改风格、做转场、修素材
三类任务的边界在具体产品里并不严格,不少工具同时提供多种方式,命名也不完全一样;各平台的实际功能、可用方式与计费以官方说明为准。

一句话概括:起点越确定,结果越可控。 文生视频把「画什么」和「怎么动」两件事一起交给模型, 图生视频只把「怎么动」交给模型,视频生视频连「怎么动」都已经定好了。

→ 想看图生视频的完整流程和提示词写法:图生视频怎么做。

起点决定可控性

为什么「一句话出片」听起来诱人,做起来却很难

文字是信息密度很低的输入。一句话里没写的部分 —— 人物穿什么、镜头怎么摆、光从哪来 —— 模型都要自己补。补得对不对,只能靠多生成几次去碰。

图片不一样:它本身就把构图、色彩、人物长相固定住了。 模型只需要回答一个问题:接下来该怎么动。 任务从「猜一个世界」变成了「补一段时间」,难度不在一个量级。

  • 要的是速度和可能性 —— 用文生视频,多跑几条挑一条
  • 要的是确定和一致 —— 先把图定住,再用图生视频

什么任务适合文生视频,什么任务该用图生视频

这一节可以直接当判断清单用。选错了方式,后面所有的返工都是这时候埋下的。

这些任务适合文生视频

  • 找灵感、试风格:还不知道要什么感觉,先快速看几种可能性
  • 现实里拍不到的抽象画面:概念场景、想象空间、超现实氛围
  • 氛围镜头与空镜:云、雨、城市夜景这类不需要精确构图的画面
  • 转场与填充镜头:整条片子里起连接作用的那几秒
  • 铺素材库:按同一套描述批量生成,之后慢慢挑
  • 只有文字没有参考图的时候:手头拿不出任何可用的起始图

这些任务该换成图生视频

  • 同一个角色要在多个镜头里出现 —— 用文字描述长相,每次都长不一样
  • 分镜已经画好了,画面有明确要求 —— 与其用文字重新描述一遍,不如直接拿图当起点
  • 画面里要出现具体的产品、真实人物或指定文字
  • 需要精确控制镜头往哪边运动、主体在画面什么位置
  • 客户或导演已经确认过某一版画面,不能重新碰运气

一个常见的错误顺序:先花大量时间用文字反复生成, 好不容易碰出一张满意的,再把它拿去图生视频 —— 这等于绕了一圈回到起点。 正确顺序通常是反过来的:先确定画面,再让它动。 只有当画面本身还不确定时,文生视频才是更前面的一步。

主流模型盘点:先归类,再谈选择

这一节只做归类,不比较参数与价格。视频模型迭代很快, 任何写死在页面上的版本号和数字都可能已经过期,所以下面只说明每个名字属于哪一类、 以及它在一条流程里大概扮演什么角色。

名称属于哪一类在流程里怎么用得上
Seedance视频生成模型被创作平台接入的一类主流视频生成模型,LibTV 公开信息里列出的接入模型之一;可作为工作流里的生成节点,具体能力与可用范围以官方说明为准
Wan视频生成模型同上,属于被平台接入的模型;具体版本与能力以官方说明为准
MiniMax模型厂商旗下的生成模型同样是 LibTV 公开列出的接入模型之一;具体能力以官方说明为准
可灵面向创作者的 AI 视频生成产品按公开定位提供文生视频、图生视频等生成能力;参数与价格以官方说明为准
即梦面向创作者的 AI 创作产品按公开定位包含图像与视频生成能力;具体功能以官方说明为准
ViduAI 视频生成产品按公开定位提供文生视频、图生视频等能力;具体以官方说明为准
海螺AI 视频生成产品按公开定位提供视频生成能力;具体以官方说明为准
RunwayAI 视频创作工具集按公开定位包含多种视频生成与编辑能力;具体以官方说明为准
本表只做归类,不排先后、不比较参数与价格。榜单式排名在这里没有意义 —— 每个模型适合的镜头类型不同,真正要看的是一条流程能不能把它们按需组合起来。各产品的最新情况请以官方说明为准。

那「文生视频大模型」这个词指什么

它指的是生成式大模型里专门处理「文字到视频」这个任务的分支,通常由几部分配合完成: 理解文字的模块、负责生成画面的模块,以及让帧与帧之间连贯的时序模块。 不同产品的组合方式不一样,所以同样叫文生视频,擅长的镜头类型可能完全不同。 具体架构与能力以官方说明为准。

选工具时更该问的问题:不是「哪个模型更强」,而是 「我的这条片子需要几种镜头?这些镜头分别适合谁来生成?换模型的成本有多高?」 在一张画布上,换模型只是换一个节点;在一键式工具里,换模型往往意味着换一个网站重新开始。

在工作流里,它处在哪一环

按工作流的五层来看(素材、决策、生成、编排、输出), 文生视频属于生成层 —— 它负责把决策变成画面,既不负责决策,也不负责编排。

更准确的位置是:它更像「填空」,而不是「打底」。

  • 打底的是关键帧画面。先确定这一镜长什么样(通常是先出一张图),再让它动起来 —— 这一步交给图生视频。
  • 文生视频常被用来做:概念草图、氛围镜头、转场与空镜,以及手头没有参考图时的第一版画面。
  • 它在流程里的价值是「打开可能性」,而不是「守住一致性」。一致性要靠资产沉淀,那是画布和节点负责的事。

一句话判断:这一镜的画面需不需要被精确确定? 需要,就先用图把它定住,再图生视频;不需要,就直接文生视频,快。
→ 想看流程整体怎么搭:AI 视频工作流怎么搭。

常见问题

文生视频是什么意思?

文生视频(Text-to-Video)指的是:输入一段文字描述,由模型直接输出一段视频。这里的文字可以是一句话,也可以是一段写清镜头、动作、光线与氛围的提示词;输出的是一段有时长的画面序列,不是一个还能继续改图层、改参数的工程文件。

文生视频和图生视频有什么区别?

图生视频的起点是一张已经确定的图,模型主要负责补运动;文生视频的起点是文字,模型要同时决定画面长什么样和怎么动。起点越确定,结果越可控 —— 所以需要跨镜头一致、需要精确构图的任务,通常更适合从图出发。

文生视频为什么不稳定?

因为模型并不像人那样「记住」上一秒发生了什么,它是根据已有的画面继续往下推测。推测得越远,偏离越多:人物会变形、物理会出错、镜头会漂。理解这一点,就不会期待它一次生成很长的镜头 —— 长镜头要拆成多个短镜头再拼。

文生视频大模型是什么?

文生视频大模型是生成式大模型里专门处理「文字到视频」这一类任务的分支,通常由几部分配合完成:理解文字的模块、负责生成画面的模块,以及让帧与帧之间连贯的时序模块。不同产品的组合方式不一样,具体架构与能力以官方说明为准。

文生视频提示词要怎么写?

可以按四层来写:主体(谁、长什么样)、动作(做什么,一个镜头只安排一件事)、镜头(景别与运动方式)、环境(光线、天气、氛围)。写不清楚的地方,模型会自己替你决定,所以宁可短而具体,不要长而含糊。写完之后先看一遍:哪一句是可有可无的,删掉它。

文生视频工具怎么选?

先分清楚你要的是「生成一段视频」还是「做出一整条片子」。只要前者,选一个自己顺手的一键生成工具就够;要做整条片子,就要看它能不能被接进工作流、能不能和角色资产配合。各平台的模型、价格与免费额度以官方说明为准。

把「碰运气」换成「定下来」

文生视频负责打开可能性,图生视频负责把它固定住。一条片子能顺利做完,靠的通常不是哪一次生成特别成功,而是每一步的起点都足够确定 —— 这也是工作流存在的理由。

与其反复碰运气,不如把它们放进一条流程

LibTV 用无限画布和节点把剧本、分镜、画面、视频、音频串在一起,接入的模型可以按镜头挑。网页端打开就能用,不用下载;价格与免费额度以官网页面为准。