图生图(image to image)到底是什么,什么时候该用
*图生图(image-to-image,简称 img2img)给模型的是一张起始图加一句提示词,让它在你已有的画面上做变换,而不是在空白画布上凭空造一个场景。* 整套行为只由一个旋钮决定——降噪强度(denoising strength):原图保留多少、覆盖多少。往低调一点,得到的是轻微改风格;往高推,模型几乎不看你的输入,越来越接近纯文生图。把这个旋钮读懂,你就能把一张手机随手拍变成一张成品插画、还不丢姿势——而这正是像 ReelWand 的 Illustration Canvas 这样的导演化工作室替你接手的活。
图生图到底是什么?
图生图是一种生成模式:模型不是从纯随机噪声出发,而是从一张已有的图出发,再朝你的提示词方向去改。你给两样东西——一张输入图和一句文字指令——模型把前者往后者的方向编辑。输出会保留你喂进去那张图的「基因」:构图、色调、大致形状。它把「生成」和「编辑」揉进了一步里。
原理其实比听起来直观。扩散模型画图,是从一片雪花点噪声出发,一步步去噪,直到画面浮现。文生图是从一片全新的噪声开始这个过程;图生图则是从你那张图、掺进一些噪声后开始,所以你的结构一开始就已经写进了起点。之后模型朝提示词去噪——但它能离起点走多远是有限的。你换掉的是雕塑家手里那块大理石,而不是雕塑家本人。
降噪强度这个旋钮怎么工作?
降噪强度——通常是 0 到 1 的数值,有的工具显示成百分比——决定的是在模型重绘之前,往你的起始图里掺多少噪声。强度低,就保留大部分原图、只轻改;强度高,就把原图丢掉大半、让提示词接管。它是图生图里最重要的一个控制项,把它的手感练出来,这门手艺就学会了一大半。
| 强度 | 效果 | 适合 | 要当心 |
|---|---|---|---|
| 约 0.1–0.3 | 轻改——保住构图、边缘和人脸 | 调色、微调风格、清理 | 太低时提示词基本被无视 |
| 约 0.4–0.6 | 主力区间——保住布局,重做表面和风格 | 照片转插画、材质替换、氛围切换 | 人脸和小字开始漂移 |
| 约 0.7–0.85 | 重改——只保住大致构图和配色 | 大胆重新诠释、宽松参考 | 身份、姿势、细节都会变 |
| 约 0.9–1.0 | 接近文生图——输入只是微弱暗示 | 想让文字说了算时 | 你的起始图几乎不起作用 |
从 0.5 左右起步,一档一档地挪。如果输出无视你的提示词,就往上推;如果它把你想保住的脸或布局弄丢了,就往下调。刻意试个一两次,比一开始就想猜中那个「完美数值」靠谱得多——对的值取决于这张图和这句提示词,没有通用公式。
图生图和文生图有什么不同?
文生图只从你的文字出发,凭空造一个模型没见过的场景;图生图则从你已有的一张图出发,把它朝文字方向改。就这一处「起点不同」,会一路影响到:你能控制什么、结果多可复现、各自擅长什么活。
用文生图,你负责描述,构图由模型决定——探索点子时很爽,需要特定布局时很憋屈。用图生图,你把布局交出去,只在「长相」上讨价还价,所以只要框、姿势、位置已经定了、你只想让它变个样,图生图就赢。代价是拿自由换控制:文生图哪儿都能去,图生图始终被你给的那张图拴着。真实工作里两者常常一起用——先用文生图找到一个构图,再用图生图把它打磨到位。
图生图和内补外扩、风格迁移、参考图是什么关系?
它们本质上是同一个念头的不同版本——给模型一张图去改——区别在于动到画面多少,以及从输入里借走什么。普通图生图是「整幅」的情形,其余几个都是它的专门化。
- 普通图生图一次性重做整幅画面,由降噪强度掌控。它是做变换和改风格的工具:把照片变成油画、把白天变成夜晚、把草稿变成成品。
- 内补和外扩是被限制在某块区域里的图生图——框内的一块蒙版区域(内补)或框外的空白边缘(外扩)——其余部分逐像素不动。蒙版怎么干活,见内补 vs 外扩。
- 风格迁移借的是参考图的长相——配色、笔触、质感——把你的内容用那种样子重画一遍,而不是直接编辑你的像素。它管的是「怎么画」,不是「画什么」。
- 参考图 / 一致性把一张脸或一件产品当作单独的条件图喂进去,好让一个全新场景保住那个身份。这正是让 AI 角色保持一致的根基——参考图锁住「是谁」,提示词定「在哪儿」。
什么时候该用图生图而不是文生图?
只要构图已经存在、你想改它而不是从白纸上重新描述一个,就用图生图。具体来说:
- 你手上有一张照片、草稿或截图,布局想留住——姿势、取景、产品位置——但长相要变。
- 你在变换一张真实的图:照片转插画、草稿转成品、白天转夜晚,或者主体不动、只做背景替换。
- 文字钉不住构图。「一个女人迈步中,四分之三侧身,左臂抬起,右手拿咖啡杯」——给它看比把它写清楚快得多。
- 你要同一个主体做多个变体,而一张参考图守住身份的能力,远比一整段文字描述强。
当你要造一个还不存在的东西、或者一张起始图只会跟脑子里的点子打架时,就留在文生图这边。也要老实承认它的边界:图生图救不了一张它从没收到过的构图。如果输入里姿势就是错的,任何降噪值都修不好——那是重拍或文生图的活,不是拉强度滑块能解决的问题。
一个实操例子:把照片变成杂志感插画
假设你有一张随手拍的手机照片,一个女人站在咖啡馆吧台前,你想把它做成一张扁平的、杂志编辑感的矢量插画,用作博客头图——姿势不变、取景不变,换的是媒介。这是标准的图生图活:构图恰恰是你要保住的,只有表面该变。
把照片载入,写一句描述目标的提示词——「扁平杂志编辑感矢量插画,有限配色,干净线条,哑光墨绿配暖奶油色」——把降噪强度设在 0.55 到 0.65。这个区间会保住吧台、站姿和大致的脸,同时把媒介彻底重画一遍。降到 0.3,你得到的是同一张照片的滤镜版,一看还是照片;推到 0.9,你会得到一个不同的女人在一个不同的咖啡馆里,只是碰巧配色接近——输入不再起作用了。手艺就在于找到那个「姿势还在、但照片味没了」的值,再多迭代一次把脸清理干净——脸永远是第一个漂移的。
降噪强度不是「质量滑块」,而是「离家多远滑块」。低,让你留在照片里;高,把你送进一张全新的图;而好结果几乎总住在那个你得靠手感摸出来的、别扭的中间地带。
这正是导演化工作室的价值所在。ReelWand 的 Illustration Canvas 带着一套服务端的 style DNA——那句「扁平杂志感矢量、干净线条、配色统一」的规则——所以你不用每次重打一遍、也不用重新找那个强度值。你把照片拿来、说你要什么;Agent 负责在每个变体之间把长相稳住,并在上一次的成图上继续迭代,而不是每次都赌一张全新的。做一次性实验,通用模型里的原始图生图给你每一个旋钮;要一套会反复复用的一致插画风格,Agent 是更快也更稳的那条路。
扔一张照片进来,描述你想要的风格,看 Illustration Canvas 一边变换一边把长相稳住。
在线试试图生图常见问题
图生图是改整幅图,还是只改一部分?
普通图生图一次性重做整幅画面,原图保留多少由降噪强度决定。如果你只想改一部分、其余逐像素不动,那是内补——被限制在蒙版区域里的图生图——而不是整幅的图生图。
降噪强度该从多少开始?
0.5 左右是个合理的默认值,再据此微调。如果模型在无视你的提示词,就往 0.6–0.7 推;如果它把你想保住的脸或布局弄丢了,就往 0.3–0.4 降。对的值取决于具体的图和提示词,所以试个一两次,比事先猜一个数字靠谱。
图生图能让人脸或角色保持一致吗?
强度低时它能相当好地保住输入的脸,但这也限制了你能变换的幅度。要让同一个角色出现在一个全新场景里,用的是参考图或条件图,而不是对单张照片做普通图生图——参考图锁住身份,提示词设定新场景。随着强度升高,脸通常是第一个漂移的,所以要预留一次清理。
图生图不就是个照片滤镜吗?
不是。滤镜对每个像素施加固定、可预测的变换——不管内容是什么,都是同一套运算。图生图是通过扩散模型、由你的提示词引导来重新生成像素,所以它能改变东西是什么,而不只是长什么样:照片能变成扁平插画,草稿能变成成品渲染。它理解这张图,滤镜不理解。
图生图需要写提示词吗?
几乎总是需要。起始图定的是构图,提示词定的是方向——变换该朝哪儿去。没有提示词,多数工具要么随机改风格,要么几乎不动输入。最清晰的结果来自一句描述目标长相的提示词,而不是描述你手里已经有的那张照片。
把它变成作品
专业图像 Agent 内置了本文所讲的创作方法。挑选一个当前可用的 Agent,开始创作。
属于 ReelWand 的AI 艺术与插画工具 工具集。