怎么给 AI 修图工具写提示词
大多数人把修图提示词当成生图提示词来写,几乎所有翻车都源于这一个错误。生图提示词描述的是你想要的整张图;修图提示词描述的是一处改动,外加明确保护其余一切。这是两件相反的活:生图时,写得越具体你控制得越多;修图时,写得越具体,模型就越有理由把本来已经对的地方重画一遍。修图提示词的实用形态是两半——先说改什么,再说保住什么。而几乎没人会写的,正是后面那一半。
生图描述一个画面,修图描述一个差值
生图时画布是空的。什么都还不对,所以你每多写一个名词——主体、光线、镜头、气氛——就等于替模型多做了一个决定。这就是为什么生图指南都叫你写具体,也是为什么三行导演式简报比堆关键词管用。
修图时画布本来就是对的,只有你想改的那一处不对。照片里是一个真实的人,有真实的脸、真实的头发、真实方向打来的光。你的任务不是描述这个人,而是别碰她。你提到的每一个名词,模型都会认为是可以动的。在一张真人照片上写「专业女性,现代明亮办公室」,你要的不是换背景——你要的是一张碰巧有点像原图的新图。
这个反转也体现在长度上。生图提示词越长越划算,因为每多一句,就少一个交给模型去替你拿的主意;修图提示词大约写到两句话就到头了——改什么,保什么。如果你写到了五句,多出来的那三句通常要么是本该拆成第二轮的改动,要么是在描述那些本来就对的地方。
每条修图提示词都有两半
先写改动,一句话:一个动词、一个对象、一个结果。「把背景换成灰色影棚墙。」「把鞋面从蓝改成红。」「删掉左边那把折叠椅。」一个动词、一个对象。如果一句话里要用两个「并且」,那你写的是两条提示词,应该分两次发。
再写保留条款:这次编辑必须活下来的东西,用名词逐个点名。不是「其余不变」,而是那份真实的清单。这半句看着多余但其实不是,原因是:模型根本不知道哪些像素是要命的。它分不清雀斑是重点、角落那盏灯不是。只有你知道,所以只能你说。
| 你想要的 | 差的提示词(像在生图) | 好的提示词(像在编辑) |
|---|---|---|
| 换背景 | 专业女性,现代开放式办公室,自然光,50mm | 只替换背景为明亮的开放式办公室。人物本人、姿态、发型、衣服,以及打在她身上的光的方向,全部保持原样。 |
| 改产品颜色 | 白底红色跑鞋产品图,影棚打光 | 把鞋面从蓝色改成红色。网布织纹、走线、鞋底、鞋带、logo 位置和接触阴影保持不变。 |
| 去掉一个物体 | 干净空旷的客厅,极简,整洁 | 删掉左边那把折叠椅。用它背后本来就露出的同一块木地板和踢脚线补上。沙发、地毯、窗户和光照不要动。 |
| 人像精修 | 无瑕肌肤,精致美颜,杂志级质感 | 压掉额头的油光,去掉左脸颊那三颗痘。皮肤纹理、毛孔、雀斑、痣和现有妆容全部保留。 |
| 重新布光 | 黄金时刻,电影感光线,暖而有情绪 | 把主光调暖并移到机位左侧,主体上的阴影与高光按这个新方向更新。主体、构图和背景保持原样。 |
| 改标签上的字 | 咖啡袋包装设计,500g | 把标签上的 250g 改成 500g。字体、字重、颜色、字距以及标签上其余所有元素保持完全一致。 |
再看一遍右边那一列,注意它有多无聊。没有夸质量的形容词,没有「超精细」,没有「8k」。修图提示词是公文。它就该读起来像给一位手快、死板、且从没见过你品牌的修图师下的工单。
要保留什么,逐个点名
「其余保持不变」是个有用的兜底,但不是策略。问题在于「其余」不是一个视觉概念——模型没有东西可以对应着去注意。「她的脸、发际线、姿态和外套」才有。点名的名词能锚住,抽象词只会飘。
这份清单不用每次现编,按主体类型基本是固定的:
- 人物——五官与身份、表情、姿态、发际线与发型、皮肤纹理、体型、衣服及其褶皱、眼镜与首饰,以及打在脸上的光的方向。
- 产品——外形轮廓、材质与表面处理、logo 与标签文字、拼缝与走线、所有你没打算改的颜色,以及让它落地的接触阴影。
- 室内与房产——建筑本体(窗、门、线脚、地板)、透视与机位高度、现有自然光方向,以及所有固定装置。
- 任何照片——构图与裁切、画幅比例,以及原图的颗粒或噪点质感,免得改过的那块看起来比整张图都干净。
挑三到六项要保住的,不要挑二十项。把画面里每个名词都列进保留条款,读起来就又变成描述了——你就绕回了最初那个问题。只保护那些「变了会被人一眼看出来」的东西。
一次只改一件事
复合编辑的翻车方式很有辨识度:模型会完成你三个请求里的大约一个半。你让它换背景、把色调调暖、再删掉那个咖啡杯,最后拿到的是一个新背景、一丝暖意,和一个还杵在那儿的咖啡杯。更麻烦的是,你分不清它到底是无视了哪条指令,还是试了但做砸了。
所以要串起来做。发一条编辑,看结果,再把那个文件喂进下一轮。三条顺序执行的提示词几乎总是赢过一条塞了三个分句的提示词,而且不会多花你任何判断力,因为每次结果都只在一个维度上非对即错。
推论同样重要:如果第二轮把第一轮的成果抹掉了,解法不是在提示词后面加一句「并保留刚才的背景」。那是在用文字重新打一场本该用文件解决的官司。回到第一轮的输出,拿它重跑第二轮。同一套逻辑也终结了「重摇」的习惯——把一模一样的提示词再发一遍、指望这次运气好,那不叫迭代。输出错了,说明提示词错了。再花一次渲染之前,先改一个词。
五步写出一条能落地的修图提示词
- 先说你是从什么开始改的,一句话。「在这张女性坐在办公桌前的照片里……」给指令一个锚点,模型就不会把你的文字当成场景描述。
- 只点名一处改动。一个动词、一个对象、一个结果。如果句子需要第二个「并且」,把它拆成第二轮。
- 把要保留的逐项点名。给出三到六个必须活下来的具体名词——脸、姿态、衣服、logo、地板、阴影——而不是一句笼统的「其余不变」。
- 补上物理约束。光的方向、透视、比例,以及新旧区域的交界怎么接。正是这一步,能避免主体保住了、背景却贴在错误角度上。
- 渲染、与原图对比、然后只改一件事。把两张图并排放,问「有什么本不该动却动了」。下一轮只修那一处,而且是对着已编辑的文件跑,不是原图。
六种典型翻车,以及真正的成因
| 你看到的现象 | 真正的原因 | 解法 |
|---|---|---|
| 换背景连人也换了 | 你的提示词描述的是一个场景,模型就重建了整个场景,人也算在内 | 把身份类不变量点名:脸、头发、姿态、衣服,以及打在主体上的光的方向 |
| 改颜色连材质也改了 | 颜色词自带材质包袱——一句「红色皮革」会悄悄把绒面换成皮革 | 拆开写:只改颜色,同时明确锁住材质、织纹、表面处理与质感 |
| 删物体后凭空多了家具 | 你说了要拿掉什么,却没说它背后该是什么,模型只好猜 | 把补图内容说明白:延续的地板、墙面,或者物体两侧本来就露着的那个平面 |
| 精修把皮肤修成了塑料 | 「无瑕」「完美」这类词没有边界——不存在一个「够了」的点 | 给它设边界:点名要去掉的具体瑕疵,并把毛孔、纹理、雀斑列进保留项 |
| 第二次编辑把第一次的成果抹了 | 你又对着原始文件下的指令,而不是已编辑的那张 | 把两轮串起来——第一轮的输出就是第二轮的输入 |
| 什么都没变 | 指令是主观的(「让它更有冲击力」「弄干净点」),没有可视目标 | 把它换成可衡量的:具体是什么变亮、变暖、变正,或者被去掉 |
盯边缘,别盯中间。绝大多数「说不上哪不对」的修图,改动区域本身是对的,错的是交界处——发际线糊了、阴影朝一边而新光从另一边来、地平线在主体背后落在了错误高度。接受一张成图之前,先沿着接缝放到 100% 看一遍。
什么时候可以让 agent 替你写保留条款
上面这一整套,是你隔着一个文本框跟通用修图工具说话时该做的事。另一条路,是用一个本来就知道要保护什么的工作室。ReelWand 的 背景替换实验室 只围绕一件编辑构建——把物体抠出来,放进新场景——所以那些不变量住在 agent 里,而不是住在一句你得记得写的话里:外形轮廓、材质与表面处理、你没打算改的那些颜色,以及一道按新台面方向生成的投影,让物体落在面上而不是飘在上头。它面向的是商品图,不是人像。你上传照片、描述新场景,而这恰好是提示词里唯一真正该由你决定的那一半。
其余 agent 也是同一种分工:杂物橡皮擦 握着「重建它背后是什么」这条规则,焕肤精修 握着「保住毛孔和纹理」这条规则。你的编辑如果有对应的 agent,就用它——保留条款正是人们最容易写错的那半,而 agent 已经替你写好了。没有对应 agent 的,就自己把两半都写全。
也说清局限:指令式修图工具擅长有边界、能点名的改动,不擅长开放式的品味判断。「删掉那把椅子」是好指令,「让它更高级一点」是给人做的简报。而且没有任何提示词能救回原本就没拍到的细节——文件糊了或者高光死白,那是重拍或放大的问题,不是提示词的问题。
上传商品图,只描述新场景——外形轮廓、材质和落地投影交给它。访客每天一张免费出图(带水印),无需注册。
锁住不变量试一次编辑常见问题
AI 修图提示词和生图提示词有什么区别?
生图提示词描述的是你想要的整张图,因为什么都还不存在,你漏掉的每个细节都会由模型替你决定。修图提示词描述的是对一张已经基本正确的图做的一处改动,并明确写出什么不能变。实际后果是「写细节」的方向是相反的:把主体写详细在生图时帮你、在修图时害你,因为你提到的每个名词都会变成模型觉得可以重画的东西。
我只让它换背景,为什么人也变了?
几乎总是因为提示词写成了场景描述而不是指令。你在一张真人照片上写「专业女性,现代办公室」,等于要了一张符合这段描述的图,而不是一次背景替换,所以模型会把人也重新生成来匹配描述。解法是把它写成带保留条款的差值:只把背景替换为 X,主体、姿态、发型、衣服以及打在她身上的光的方向保持不变。
能把多处编辑写进一条提示词里吗?
不建议。复合编辑不会干脆地失败,而是部分失败——模型通常完成一条指令、半完成第二条、悄悄无视第三条,而你从输出里根本分不清是哪种情况。一轮改一件事,把每次结果喂进下一轮。三条顺序提示词一共花三次渲染,和把一条塞满的提示词重摇三次花得一样多,区别是这三次每一次都攒下了一个能留用的结果。
修图时还需要负向提示词吗?
比生图时需要得少得多。在指令式修图工具上,一条写好的保留条款就干了负向提示词过去干的活——写「保留皮肤纹理和雀斑」比列一堆「不要塑料皮肤、不要过度磨皮」有效得多。在 Stable Diffusion 一类引擎上负向提示词仍是真实的采样控制,边界在哪可以看我们的负向提示词科普。
同一条提示词反复重发还是同样的坏结果,怎么办?
别再重发了。原样重摇不叫迭代——输出错了说明指令错了,同一条指令只会继续产出同一类错误。改动一个环节:把主观词换成可衡量的、把复合请求拆成两轮,或者补上那个总被破坏的不变量。如果改写了好几版都在同一处失败,那这项改动可能超出了提示词的能力范围,该换专门工具或手动蒙版来做。
把它变成作品
专业图像 Agent 内置了本文所讲的创作方法。挑选一个当前可用的 Agent,开始创作。
属于 ReelWand 的AI 产品摄影与图片处理 工具集。