AI 修图该一次改完,还是分步修改?
结合咖啡馆教学场景与图像编辑研究,组织相互关联的改动,检查保留细节,并判断何时继续或回退。
本页目录
一张图已经很接近你想要的样子:构图不错,光线也舒服。你只想换掉椅子软包的材质、拿走纸杯,再给桌面加一只花瓶。这三件事,应该一次说完,还是分三次做?
先看修改之间的关系,再决定轮数。 最终要求明确、没有冲突时,可以把它们组织在同一份指令里;需要看过中间结果才能作决定时,就分步推进。光线与阴影这类相互关联的变化,应说明它们怎样一起改变。无论选哪条路,每次都要检查新要求和原本满意的部分。
本文是一篇决策指南。咖啡馆画面是专门制作的 AI 教学插图,用来解释任务和检查位置;没有进行“一次提交与多轮编辑”的性能对照,也不据此判断哪种方法更稳定。
先把“还想改一点”写成具体任务
假设下面这张图要用于咖啡馆的室内介绍。窗户、桌椅位置和地砖构图已经满意,新的要求是:
- 椅子软包:坐垫与靠背的砖红布料换成深棕皮革,保留木架与靠背形状。
- 纸杯:从桌面移除,杯子原来的位置恢复为连续木纹。
- 桌面右侧:放一只小型奶白陶瓷花瓶,不挡住窗户。

这份清单还差一半:哪些东西不能跟着变? 在这个案例里,是相机位置与裁切、窗框分格、桌椅的结构和位置、地砖接缝,以及原有日光方向。软包颜色和反光则需要随着新材质变化,不能同时要求它们完全不动。
这里的“保留”是可检查的目标。生成式编辑是否做到,需要对照原图判断;把“严格保持”多写几遍,并不会自动锁住像素。
按修改的关系组织指令
下面三种情况,值得采用不同的工作安排。这是本文的编辑建议,不是模型性能排名。
最终要求明确,可以先合在一份简报里
换软包、去纸杯、在指定位置加花瓶,分别指向不同的对象或区域。如果你已经确定三项都要做,可以一次列清,再分别验收。一次提交也可以有清楚的层次,并不等于把要求挤成一长串形容词。
当结果漏掉某一项,或你需要判断是哪项要求造成了误解,再考虑拆开。拆分的价值首先是让你更容易定位问题;它本身不是质量保证。
如果改动数量太多,可以按画面区域或交付目标整理。例如先列家具变化,再列桌面布置,最后列保留条件。分组是为了把简报写清楚,并不要求每组都单独生成。
变化互相关联,要一起交代它们的关系
现在换一个任务:把同一个咖啡馆从白天改成蓝调傍晚。
这不只是把窗外涂蓝。室内从窗户得到的光、壁灯的亮度、桌面受光与地面阴影,都需要与新的时间一致。此时可以要求“保留窗框与家具结构”,却不宜同时要求“所有高光与阴影完全不变”。

更完整的写法是:“改成蓝调傍晚,让窗边冷色环境光、暖色壁灯和物体投影彼此匹配;保持机位、窗框分格、家具几何与摆放。”这是一组共同服务于“傍晚”的要求,不必机械地按名词拆成不同轮次。
下一步还没决定,就保留中间判断
另一种情况是,你只确定纸杯碍眼,尚不确定桌面是否需要花瓶。
此时先移除纸杯,检查木纹是否连续、空桌面是否已经足够,再决定是否增加摆件。这里的分步有明确用途:为尚未作出的设计决定留一个观察点。 如果留白已经舒服,停止就是合理结果。
这和“我早已知道三项要求,只是分三次提交”不是同一种任务,不能拿两者直接证明哪条流程更有效。
为什么“一次改完”和“分步更稳”都不是定律
关于复杂图像编辑的研究,确实观察到了两边的问题。Zeng 等人在 CVPR 2026 的工作讨论了复杂单次指令的执行错误,以及简单串联编辑时的误差累积。但它的改进方案包含特定训练与推理设计,实验模型和任务也有明确范围;不能把论文读成“普通用户分三次输入一定更好”。
论文还区分了跨步指代关系:后面的指令可能提到前一步改变的物体,或物体原来的位置。这样的上下文依赖,与上文“看完空桌面才决定是否加花瓶”的需求探索不同。本文借研究提出检查问题,不把自己的工作建议说成论文验证过的通用流程。全文与任务定义
同时,多轮编辑本来就是现代图像工具支持的使用方式。Google 的图像生成文档提供对话式图像迭代;OpenAI 在 2026 年 9 月的 Images 2.5 发布说明也把编辑精度与多轮一致性列为改进方向。这些说明支持尝试迭代,不构成每一张图都能保持细节的承诺。
因此,选择轮数时最值得问的是:这一步需要完成什么,我会用什么依据决定是否继续?
每轮都要看“改到了什么”和“带走了什么”
只盯着新花瓶,很容易忽略椅背已经变形,或者上一轮刚确认的皮革又变回了布料。检查应分为两个部分,并始终能找到原图与已确认的版本。
先看目标改动。 材质真的变了吗,还是只变了颜色?纸杯及其残留影子是否去除?新花瓶的数量、位置与遮挡是否符合要求?
再看保留条件。 窗框分格是否改变,桌腿是否仍正确连接,地砖接缝是否连续,画幅是否被重新裁切?此前已经接受的修改,也要在新版本里重新确认。

先并排看全图,再以相近的显示比例检查局部,最后回到实际使用尺寸。不要仅凭某张图在页面上显示得更大,就认定它有更多可信细节。关于尺寸和锐度的区别,可以接着看清晰度指南。
如果这一步是改傍晚,照明变化属于任务;如果这一步只是移除纸杯,整屋忽然变成暖黄色就需要追查。验收条件要随任务明确,而不是永远使用一份“全部不变”的清单。
OpenAI 的图像提示指南建议检查每次输出和完整编辑序列,并指出重复编辑仍可能改变需要保留的细节。对创作者而言,可以把每轮结果简单记成三种状态:通过、未通过、看不清。关键部位看不清时,不要把它当作已通过。
继续上一张,还是退回较早版本
继续编辑前,先判断问题出在哪里:
| 当前情况 | 下一步 |
|---|---|
| 必须保留的部分通过检查,只剩明确的新要求 | 可以继续使用当前版本,重述新目标和关键保留条件 |
| 本轮漏改一个目标,其他部分仍符合要求 | 尝试针对遗漏作一次明确修订,再完整检查 |
| 当前图的关键结构或已确认内容出错 | 回到最近一个通过检查的版本,缩小或改写这一步的要求 |
| 已经找不到可信的中间版本 | 从原图重新组织最终简报;再次检查全部要求 |
| 已达到用途,新增装饰没有明确价值 | 保存交付文件,结束编辑 |
这张表是排查顺序,不保证回退之后一定更好。回到原图能给你一个已知参照,也意味着此前做过的修改需要重新说明。
例如,你从原图重来时只写“加一只花瓶”,原图里的纸杯仍然在,椅子软包也是旧材质。从原图重做,要写累计的最终要求;从已确认版本接着改,要写本轮变化,并提醒哪些已完成结果需要保持。
下面是一份“从原图重新提交”的写法示例。它用于说明简报结构,未作为本篇的编辑效果实验运行;使用时应替换成你自己的任务。
查看提示词收起提示词
编辑所提供的咖啡馆原图,完成以下最终要求:
1. 将坐垫和靠背的砖红色软包布料改成深棕色皮革,保留木架、靠背形状与椅子位置。
2. 移除桌上的纸杯及其对应阴影,在原位置延续桌面的木纹与受光。
3. 在桌面右侧空位放置一只小型奶白陶瓷花瓶,不遮挡窗户,不增加其他物品。
保留相机位置、画幅裁切、窗框分格、桌椅几何、地砖接缝和日光方向。
允许新材质产生相应反光,允许花瓶产生与原有光线一致的阴影。
不要重新布置房间、改变家具数量或增加文字。
保存文件时,用“原图”“去杯后已检查”“最终候选”这样能理解的名称即可。不要只留下最后一张,也不要把生成时间更晚自动等同于质量更好。
比较两条流程时,把输入与目标说清楚
如果你想亲自验证一次提交和分步编辑,先固定原图、最终目标、必须保留的部分、工具与可见设置。保留每一步输出,并记录最后为什么选某个版本。两条路线都完成任务,也是有效观察。
尤其要写清楚,后续每轮到底拿到了什么:只重新附上上一张图片,保留完整对话历史,还是同时附上原图与当前版本。它们提供的上下文不同,不能一概叫“多轮”后就认为条件一致。多图工具中,还应明确每张参考的职责,避免两张图互相争夺同一项要求;具体可看多参考图指南。
一次提交与三次提交的调用次数不同。即使最后放在一起比较同一个目标,也不能直接得出“同预算下更优”或“更省时间”的结论;这些需要另行记录成本、等待、失败与返工。单个案例也不能估算普遍成功率。
必须原样保留的部分,采用相应的制作方式
有些交付要求允许视觉上的相似,有些要求品牌字样、人物或产品区域原样保留。两者需要不同的验收方式。
对于必须保留原像素的区域,可以在图层编辑器中保留原始图层,只合成允许变化的部分,再检查蒙版边缘、颜色处理与最终导出。OpenAI 的提示指南也将合成作为严格像素保持要求的处理方式;这不是靠一句“不要改变”就能替代的步骤。
接下来可以把自己的修改任务写成两列:希望改变的内容,以及需要保留的内容。再标出其中必须一起变化的关系、需要看效果才决定的事项。若要进一步了解单项编辑的验收方式,可阅读背景、光线与材质编辑实测;其中结果属于注明日期的实验,不是本篇多轮流程的测试。



