AI片场AI 视频工作流指南 免费注册体验
从零开始 · 七步路径

AI 视频怎么做?
从一句话到成片的七步路径

会搜这个问题的人,多半连工具都还没打开。这很正常 —— 你缺的不是技术,是一张「我该按什么顺序做什么」的路线图。
下面把 AI 视频拆成七个步骤,每一步都写清三件事: 这步在干嘛、新手最常卡在哪、最小可行做法是什么。 照着走一遍,你就有了自己的判断力。

七个步骤逐步拆解 每步写清新手卡在哪 网页端,不用下载

七步总览

从一句话到成片,中间隔着七步

先看全景,再看细节。这七步就是一条完整路径 —— 每少走一步,它都会在后面以返工的形式还回来。

  • 01定选题给谁看、想让人记住什么
  • 02写剧本把想法写成有开头有结尾的文字
  • 03拆分镜把文字切成一个个可执行的镜头
  • 04定角色让主角在几十个镜头里长一个样
  • 05生成画面先出静帧,确认了再往下走
  • 06生成视频让确认过的画面动起来
  • 07配音剪辑声音、节奏、字幕、成片
先给结论

按「定选题 → 写剧本 → 拆分镜 → 定角色 → 生成画面 → 生成视频 → 配音剪辑」这个顺序做一遍。先做完一条 15 秒的,再谈做好。

新手最容易犯的错,是从第五步开始:打开工具就生成画面,结果没有剧本、没有分镜, 生成出来的东西串不成片子,只能反复重来。顺序对了,每一步都有上一步的结果兜底; 顺序错了,你会在工具里空转一整周。

这条路径不适合谁:如果你只是想要一段素材发个动态、并不打算做成一条片子, 那不用走这七步 —— 直接用一键生成类工具更快,别折腾流程。

先破除一个误解:AI 做视频不是「一句话出片」

很多人搜「怎么用 AI 做视频」,脑子里想的其实是「输入一句话,AI 就给你一条完整视频」。 这是宣传片里的效果,不是真实的工作方式。 真实情况是:AI 能替你做的是每个环节里的重复劳动,而环节之间的顺序和判断,仍然要你自己定。

为什么会这样?因为视频是「多镜头 + 时间轴」的东西。 一句话可以描述一个画面,但描述不了一条片子里十几个镜头之间的关系: 谁在第几秒出现、镜头怎么切、情绪怎么递进。这些是结构问题,不是生成问题, 而结构问题目前没有哪个模型能替你决定。

所以更接近真实的心智模型不是「指挥一个会做视频的 AI」,而是你当导演,AI 当剧组。 剧组能执行、能干活、能出活儿,但它不会替你决定要拍什么。

一句话记住这个区别:一句话生成解决的是「我要一个画面」, 工作流解决的是「我要一条片子」。这是两件不同的事 —— 不要用前者的期待去要求后者,也不要用后者的标准去否定前者。

完整路径:七个步骤

下面是这条路径的展开。每一步都按同一个结构写: 在干嘛 / 新手最常卡在哪 / 最小可行做法。 建议先照着走一遍,遇到卡点了再回头读解释。

第一步:定选题

  • 在干嘛:决定这条片子给谁看、想让人记住什么。选题不是「我想做什么」,而是「谁会看完」。
  • 新手卡在哪:最大的坑是跳过这一步。直接从「我想做个赛博朋克短片」开始,做到一半才发现没有一句能说清的主题 —— 画面再漂亮也拼不成片子。
  • 最小可行做法:用一句话把选题写下来,句式是「给____看的、关于____的、大概____秒的片子」。写不出这一句,就先别打开工具。

第二步:写剧本

  • 在干嘛:把脑子里的想法变成有开头、有推进、有结尾的文字。短视频不需要复杂结构,但需要一条清楚的主线。
  • 新手卡在哪:两种极端。一种是想一口气写出完整对白,写了两千字才发现根本拍不了;另一种是懒得写,直接跳到画面,边生成边想故事,最后拼不出逻辑。
  • 最小可行做法:先写「三句话剧本」—— 开头发生了什么、中间发生了什么变化、结尾停在哪。三句话成立,再扩成几十秒的内容。

第三步:拆分镜

  • 在干嘛:把文字切成一个个镜头,并决定每个镜头是什么景别、大概多长、画面里有什么。这是从「文字」到「画面」的桥。
  • 新手卡在哪:这是全流程最被低估、也最痛苦的一步。很多人以为分镜是形式主义,跳过它直接生成,然后卡在「生成了一堆好看的画面,但拼起来不像一条片子」。
  • 最小可行做法:用表格写,一行一个镜头,列只要四个 —— 镜号、画面内容、景别、时长。先写满六到八行,比什么都强。

→ 分镜表具体怎么写:分镜头脚本怎么写

第四步:定角色

  • 在干嘛:确定主角长什么样,并把这个形象固定下来,让它在所有镜头里保持一致。
  • 新手卡在哪:这是 AI 视频的第一大翻车点。同一个角色,第 3 个镜头和第 17 个镜头可能完全不是一个人 —— 换脸、换发型、换衣服。原因不是模型不行,是每个镜头都在从零开始理解「这个人长什么样」。
  • 最小可行做法:先把角色单独做成一组定妆图(正面、侧面、半身),当成资产存下来;之后每个镜头都从这组图出发,而不是用文字重新描述一遍。角色越少、镜头越多,这一步省下的时间越明显。

第五步:生成画面

  • 在干嘛:按分镜逐个镜头生成静帧画面 —— 先出图,再出片。
  • 新手卡在哪:一上来就想直接生成视频。视频生成比图片更慢、更难改,画面构图不对的时候,你只能整段重做。
  • 最小可行做法:先把每一个镜头都生成出一张满意的静帧,全部满意了再进入下一步。这一步的产出是一组图,不是视频。

第六步:生成视频

  • 在干嘛:让已经确认过的画面动起来 —— 图生视频,或者按分镜逐条生成镜头。
  • 新手卡在哪:动作幅度失控。让 AI 动得太多,脸和手容易崩;动得太少,画面像幻灯片。而且每次生成结果都不一样,很难精确复现上一次的效果。
  • 最小可行做法:一个镜头只让它做一个动作。「转头」就只转头,不要同时要求走位、说话、做手势。单镜头失败就单独重做,不要推翻整条片子。

第七步:配音剪辑

  • 在干嘛:配音、配乐、音效、字幕,按时间轴拼成成片。
  • 新手卡在哪:很多人到这一步才发现前面的镜头长度不对 —— 配音一句话四秒,镜头只有两秒,只能回头重做。也有人在这里才开始学剪辑软件,把一个晚上的活拖成一周。
  • 最小可行做法:先定配音,再定镜头长度。把配音先做出来,量出每句话的真实时长,再回去调整镜头长短,比反过来省事得多。

七个步骤里,真正决定成败的是第三步和第四步。 分镜决定你的画面能不能拼成片子,角色决定你的片子看起来像不像同一部作品。 这两步做扎实,生成环节的返工会少很多;这两步跳过,换再强的模型也救不回来。

三条不同起点的路线

上面那七步是通用路径。但每个人的起点不一样 —— 你已经会的东西,没必要再从头学一遍。对照下面三条路线,看自己该把力气花在哪。

起点一:纯新手,没剪过片子

你要补的是结构感,不是软件操作。七步一步都别跳,但把规模压到最小:一条 15 秒、三个镜头的片子,完整走完一遍,比看十篇教程都有用。

先别碰:多角色剧情、长镜头、复杂转场。这些等你跑通一遍之后再回头加。

起点二:会剪辑的人

你的优势在最后一步,短板在前四步。直接从第三步(拆分镜)开始认真做,第七步用你熟悉的剪辑软件收尾就行,不必强求全流程都在同一个工具里完成。

一个提醒:剪辑经验有时是负担。你会下意识地想「这段素材不够,我再补拍一条」—— 但 AI 视频里补拍等于重新生成,成本完全不同。

起点三:已经在用即梦、可灵

你已经会生成单段视频了,卡住你的通常不是生成质量,而是拼不成整片。把力气放在第三步和第四步上 —— 分镜结构和角色一致性。

这两件事解决之后,你现有的生成能力会立刻变得可用。原理可以先看:AI 视频工作流怎么搭。

动手前要准备什么

这一节是给「还没开始」的人看的。真正需要准备的比你想象的少, 但有几件事提前想清楚,能省掉不少情绪成本。

要准备的具体是什么为什么
硬件 一台近几年买的普通电脑,或者干脆先用平板、手机浏览器 网页端平台的生成在云端完成,本地主要负责操作和预览,不需要为它单独换设备。具体设备与浏览器要求以官网页面为准。
浏览器 Chrome 或 Edge,保持较新版本 画布、节点连线、实时预览都比较依赖现代浏览器的能力,版本太旧容易卡顿或显示异常。
一个账号 先免费注册,不要一上来就付费 第一次的目标是跑通流程、确认自己能不能接受这套工作方式。免费能用到什么程度、超出之后怎么计费,以官网页面为准。
心态预期 接受「第一条做出来大概率很丑」 七步走完第一条片子,不好看是正常的。第一遍的目的是把流程跑通,第二遍才开始谈质量。
一段完整时间 尽量一次留出连续的两三个小时 碎片时间做 AI 视频最痛苦:每次回到画布都要重新想起「上次做到哪了」。这是经验值,不是硬性要求。
设备、浏览器与计费相关的具体要求,均以 LibTV 官网页面为准。

第一周最容易崩的地方

下面这五个地方,几乎每个人都会撞上一次。提前知道,至少不会以为是自己不行。

  • 崩溃点一:画面很漂亮,但拼不成片子。原因通常不在生成环节,而在第三步 —— 分镜没拆,画面之间没有关系。回到分镜表重写,不要在生成环节反复试。
  • 崩溃点二:同一个角色越做越不像。别再用文字重新描述角色了。把定妆图固定下来,每个镜头都从它出发,而不是每次重新「形容」一遍。
  • 崩溃点三:改一句台词,前面全废。这说明流程没有把「决策」和「生成」分开。手工重做一次可以接受,第二次就要想办法把能复用的部分固化下来。
  • 崩溃点四:一整天都在等生成,什么都没做成。把等待时间用来做下一步的准备 —— 写第二组分镜、准备配音文案,而不是盯着进度条。
  • 崩溃点五:额度用完了,开始怀疑这事值不值。先问自己一句:我卡住的是额度,还是流程?如果是流程,充钱也解决不了。计费方式与额度规则以官网页面为准。

一句实话:AI 视频的门槛不在软件,在流程。 如果你一周之内连一条 15 秒的练习都没走完,问题多半不是工具太难, 而是你跳过了分镜和角色这两步。先按顺序做完一条,再判断要不要继续投入。

常见问题

AI 视频怎么做?第一步该做什么?

第一步是定选题,不是打开工具。先把「给谁看、关于什么、大概多长」这一句话写下来,写不出来就说明选题还没想清楚。工具随时可以学,顺序错了却会在后面反复返工。

完全不会剪辑,能学会做 AI 视频吗?

能开始,但要接受一件事:AI 视频的难点不在剪辑,在分镜和角色一致性。剪辑环节用你顺手的软件收尾就行,不需要为了做 AI 视频专门成为剪辑师。真正需要练的是把一段文字拆成镜头的习惯。

AI 做视频真的能一句话出片吗?

不能。一句话能生成一个画面,但一条片子里十几个镜头之间的关系、时长和情绪递进,是结构问题,不是生成问题。把它理解成「你当导演、AI 当剧组」更接近真实情况:剧组能执行,但不替你决定要拍什么。

为什么一定要先做分镜?

因为分镜是「文字」和「画面」之间唯一的桥。没有分镜就直接生成,你会得到一堆各自好看、但彼此没有关系的画面,最后拼不成片子。分镜表不需要专业格式,一行一个镜头、写清画面内容和时长就够用。

从零做一条 AI 视频要多久?

本站不给固定时长,因为差异太大:镜头数量、返工次数、你对分镜和角色的熟悉程度都会影响结果。可以确定的是,时间主要花在分镜、角色一致性和返工上,生成本身往往是最快的一环。

只想在手机上做,可以吗?

LibTV 是网页端工具,不需要下载客户端,手机浏览器能不能顺畅使用,请以官网说明和你自己的实际体验为准。可以确定的是,写剧本、改文案、看进度这类事在手机上没问题,分镜表和多镜头预览还是在大屏上做更省力。

学这套流程要花钱吗?

可以先不花钱。LibTV 可以免费注册体验,生成按算力计费,深度使用需要会员或算力包。免费额度和具体价格以官网页面为准,建议先把一条 15 秒的练习跑完,再判断值不值得投入。

最短的走法:拿一套现成模板,把七步跑完一遍

LibTV 是哩布哩布 AI(LiblibAI)推出的 AI 视频创作平台,网页端打开就能用,不用下载。它预置了工作流模板,免费注册后可以直接改 —— 比从空白画布开始省事得多。先用 15 秒的片子把七步走通,再谈做长内容。