文生视频 vs 图生视频:该用哪一个?
一句话结论:要凭空创造场景、追求速度,用文生视频;已经有产品图、角色或 logo 且需要它保持原样,用图生视频。 文生视频只凭一段文字提示、无需任何素材就能生成一段镜头;图生视频则从你上传的静帧出发,在其之上叠加动态——所以主体始终可辨认。下面是精确定义、一张决策表,以及两条真正好用的工作流。
两种模式的定义
文生视频接收一段文字描述,从零生成整段镜头——主体、构图、打光、运动全都由模型创造。你给的是文字,模型造的是画面。它是从想法到动态影像最快的路径,也是你手上完全没有素材时唯一的选择。
图生视频从你提供的一张静帧出发,为它添加动态。你的图就是锚点:模型在保留你交给它的观感的同时,加入相机运动和主体运动。因为首帧被固定,结果要可预测得多——当主体是真实产品、特定人脸,或必须被忠实还原的品牌 logo 时,这正是你想要的。
一个好用的心智模型:文生视频回答的是「它可能长什么样?」,图生视频回答的是「让这个确定的东西动起来」。前者是探索,后者是控制。
什么时候文生视频更合适
- 手上没有素材。 只有一个想法、一句台词、一种氛围,却没有可供动画的图。文生视频是唯一的起点。
- 求快、求量。 想快速拿到一个场景的十种变体来找方向。敲一段提示词,比先去拍摄或先生成一张静帧更快。
- 纯想象。 不可能的镜头、虚构的世界、从未发生过的运镜。没有需要忠于的原型,模型可以自由发挥。
- 早期探索。 你还没定这个镜头到底是什么。文生视频是敲定观感前的草稿本。
什么时候图生视频更合适
- 必须让真实的东西动起来。 产品图、人物头像、包装图、logo。图生视频让它保持可辨认;文生视频会把它重画成一个「差不多」的东西。
- 品牌还原。 精确的颜色、精确的字体、真实的产品型号。静帧锁住了身份,视频就不会跑偏离品牌。
- 跨镜头一致。 把同一张参考喂进每一段镜头,角色或产品就能在镜头之间保持外观。参见如何在 AI 视频里保持角色一致。
- 输出可预测。 当你已经知道想要哪一帧,让它动起来,好过押注一次可能失手的全新生成。
参考图早已不只是单张「初始帧」。像 Seedance 2.5 这样的模型支持最多 50 个参考输入——图像、风格、音频,甚至 3D——图生视频正在变成「素材生视频」:你可以同时用一张角色设定图、一处场景和一块色板来给模型定调。
决策表:这活儿该用哪个
| 你的情况 | 用 | 原因 |
|---|---|---|
| 没有素材,只有一个想法 | 文生视频 | 没有可动画的东西,凭提示词创造 |
| 让真实产品 / 照片 / logo 动起来 | 图生视频 | 静帧锁住身份和品牌观感 |
| 需要 10 个方向快速对比 | 文生视频 | 拿到多样性最快 |
| 同一角色贯穿多个镜头 | 图生视频 | 一张参考让外观逐镜保持 |
| 不可能的或虚构的世界 | 文生视频 | 没有真实主体需要忠于 |
| 精确颜色 / 型号 / 字体 | 图生视频 | 品牌还原来自源静帧 |
| 先探索概念,再敲定 | 两者都用 | 文生探索 → 静帧 → 图生视频定稿 |
两条真正好用的工作流
先用文生探索,再用静帧锁定。 先在文生视频里找构图和氛围——便宜、快、用完即弃。一旦某一帧对了,就把它导出(或生成一张干净的静帧),切到图生视频去产出最终的动态成片。你既拿到了前期文字的自由,又拿到了末端固定帧的控制。
当主体已确定,直接从静帧起步。 如果任务是「让这只鞋动起来」或「让这张创始人头像开口说话」,就完全跳过文生视频。上传素材,再加上风格和运动的辅助参考,让图生视频把主体保持不脱形。这是产品、UGC 和品牌内容的可靠路线——和保持品牌形象一致背后的逻辑一致。
文生视频是一张用完就扔的草稿,图生视频是一帧你愿意定稿的画面。大多数真实项目,都是用前者找到后者。
ReelWand 的 Agent 如何兼顾两者
ReelWand 的视频 Agent 把两种模式放在同一处,区别只在于你是否附上一张参考。什么都不附,你就是在做文生视频;附上一张产品图、头像或 logo,Agent 就以你的素材为锚点跑图生视频。导演分镜工作室 内置一套固定的风格 DNA——有动机的打光、胶片调色、有动机的运镜——在服务端拼进每一次请求,因此探索和终稿共享同一套观感。
真正的回报在于迭代。会话记忆意味着你的下一句提示是在上一帧成片的基础上打磨,而不是从零开始——微调相机、调整调色、保持主体——于是文生视频的草稿和它的图生视频定稿活在同一条线程上。这正是一次真实剪辑能在几十次尝试里保持连贯的方式。
从文字起笔,或附上一张参考图——一个 Agent,一套观感。
用导演分镜工作室同时驾驭两种模式常见问题
文生视频和图生视频有什么区别?
文生视频只凭一段文字提示、无需任何素材就生成整段镜头;图生视频从你上传的静帧出发并为其添加动态,让主体保持可辨认。文生用于创造场景,图生用于让一个确定的东西动起来。
真实产品或 logo 更适合哪一个?
图生视频。因为它锚定在你提供的静帧上,能保留精确的颜色、字体和真实产品——这种品牌还原是文生视频无法保证的,后者会凭文字重画整个场景。
什么时候应该改用文生视频?
当你没有素材、需要求快并生成多个变体来探索方向,或者想要一个不可能的、虚构的镜头时。文生视频是草稿本,从想法到动态影像最快。
两者可以配合使用吗?
可以,而且大多数真实项目都这么做。先在文生视频里探索构图,导出一帧好画面,再切到图生视频产出最终的、不脱形的成片。前期自由,末端控制。
图生视频能用多少张参考图?
取决于模型。Seedance 2.5 这类更新的模型支持最多 50 个参考输入——图像、风格、音频、3D——把图生视频变成「素材生视频」的工作流:同时用角色设定图、场景和色板给模型定调。
把它变成作品
62 个专精视觉 Agent,每一个都内置了本文所讲的手艺。挑一个,开始创作。