AI 图片构图指南:从视觉层级到可验证的创作决策
结合视觉注意研究、夜读海报简报与保留缺陷的示例,分别检查 AI 图片的内容正确性、视觉主次与最终版式。
本页目录
构图要从图片的用途出发:先写清必须保留的内容、主次与排版空间,再分别检查内容是否正确、重点是否清楚、成品是否可用。
为什么画面已经很精致,主题却仍然不清楚?
假设你正在为一家独立书店制作夜读活动海报。
你输入“打开的书、温暖的台灯、夜晚、电影感、精致细节”,得到了一张漂亮的图:灯罩发光,窗外有层次丰富的城市灯影,桌面木纹也很真实。
但你真正想讲的是“今晚,来这里读一本书”。
如果画面更像台灯广告,或者标题只能压在复杂的窗框上,那么问题就不是细节不够,而是画面没有把创作目的组织起来。
本文把构图作为一项可以规划、检查和修改的工作:既决定物体放在哪里,也决定哪些信息应该突出、哪些信息只需支持主题。
核心方法是:先明确图片要完成的任务,再把要求写成可观察的关系,最后对着成品逐项验收。
本文将视觉研究转化为创作检查方法。图解由编辑绘制,场景图由 OpenAI 图像生成工具制作,保留了未满足要求的细节;没有在 LocalBanana 运行生成,也不报告模型成功率。文末对照练习尚未执行。
一、先分清:内容正确、重点清楚、成品可用
评价一张 AI 图片时,不要急着给它一个综合分数。
对于有明确用途的创作,本文建议分开回答三个问题。
| 检查层 | 要回答的问题 | 夜读海报中的例子 |
|---|---|---|
| 内容正确 | 对象、数量、属性和关系是否符合要求? | 只有一本打开的书;台灯在书的左侧;书没有变成两本重叠的本子。 |
| 重点清楚 | 画面强调的信息,是否与创作意图一致? | 书页和阅读空间能够被辨认;窗外灯光没有把主题变成城市夜景。 |
| 成品可用 | 放进实际版式后,图片能否完成任务? | 标题、日期可以清楚排入;实际裁切没有损伤书的关键轮廓。 |
这是本文的项目检查表,不是通用的美学评分体系。
图文一致性研究也提醒我们,需要把“是否画对”作为独立问题。TIFA 将提示词拆成可回答的问题,再检查图像是否符合描述;它研究的是忠实度,而不是一张海报是否完成了传播任务。 TIFA 原论文
因此,不要让“整体很好看”替一个关键错误开脱。对于这个项目,少了一本必须出现的书、标题放不下,或者活动日期写错,都不能靠更好的光影抵消。
同样,视觉层级不是要求每张作品只能有一个兴趣点。本文采用明确主次,是因为这个海报练习需要清楚传达活动主题。多中心叙事、刻意的混乱和视觉谜题,也可以是合理的创作目标。
二、理解构图,需要三条有边界的理论线索
1. 视觉显著性解释“哪里突出”,不能单独解释“人会看什么”
Itti、Koch 与 Niebur 的经典研究将多尺度视觉特征整合成显著性图,用于预测值得优先处理的图像位置。它为从图像差异理解注意分配提供了一种计算模型。 Itti、Koch 与 Niebur,1998
但人并不只是响应亮度和边缘。
Henderson 与 Hayes 的场景观看研究发现,区域的语义信息也能解释注视分布;后续研究对“意义地图”能否独立测量语义贡献提出了质疑,原作者则回应了地图的测量目标。具体机制与测量方式仍有争论。这里更稳妥的结论是:不能把观看行为简化成一个最亮区域规则。 原研究、后续质疑、作者回应
转化到本例,创作时可以提出一个需要检验的判断:
如果书是主题,就应同时检查书本身是否容易识别,以及其他区域是否提供了过强、却与主题无关的视觉刺激。
假设窗外多出一块抢眼的霓虹招牌,下一步未必是让整本书更亮。也可以先减弱那块招牌的亮度、色彩或细节。
两种操作的区别在于:前者继续强化主体,后者减少竞争。你需要对照具体画面,决定哪一种更合适,而不是把所有地方一起加对比度。
这里讨论的是人类观看图像时的注意。它与生成模型内部被称为 attention 的计算机制不是同一个概念,也不能由此推出某个模型必然如何理解提示词。
2. 主体不仅要出现,还要能从周围被辨认出来
Wagemans 等人的综述区分了知觉分组与图形—背景组织:我们不仅识别局部元素,也会组织哪些部分属于同一对象、轮廓属于哪一侧,以及表面之间的关系。 Wagemans 等,2012
本文据此建议增加一项很具体的构图检查:
关键轮廓有没有被周围的颜色、线条或遮挡弄得含混?
在夜读海报中,可以检查书页外沿有没有与桌面融成一片,灯杆是否刚好沿着书脊重叠,窗框是否贴住书的边缘,让两个无关物体看起来像一个结构。
需要修正时,试着描述问题所在的关系:
让书页外沿与桌面保留可辨认的明暗分界;灯杆与书脊错开;不要让窗框紧贴书的外轮廓。
这比“主体更突出”更容易在结果中核对。它仍然是创作指令,不是边缘必定准确保留的技术保证。
也不必把每一段轮廓都描得很硬。这个练习的目标是让书容易辨认,不是消除所有遮挡、柔边和氛围。
3. 画出了所有名词,不等于画对了它们的关系
T2I-CompBench 将组合生成拆成属性绑定、对象关系和复杂组合等类别。这里的“组合”指概念和文本要求是否被正确组合,不等于美术意义上的构图质量。
例如,“黄色台灯旁边有一本蓝色封面的书”,不仅要求出现台灯和书,还要求颜色属于正确对象、空间关系符合描述。 T2I-CompBench,2023 原版
这对创作者的启发是:把提示词从物件清单,改写成关系说明。
“书、台灯、夜景、温暖”只列出了构成元素;“台灯在书左侧,光落在打开的书页上,夜景限制在右上方的小窗内”,进一步交代了这些元素如何共同构成画面。
不要把早期研究中某个模型的表现直接套给所有新模型。这里借用的是研究对问题的拆分方式,而不是把旧榜单当成今天的能力上限。
三、把“高级、治愈、有电影感”变成可执行的创作要求
情绪词可以保留,但不要让它们独自承担构图任务。
在这个练习里,我们对“安静的夜读”作出如下解释:
书页形成主要的可辨认亮面;台灯负责说明光源;窗外只提供夜晚的环境线索;画面还必须容纳活动文字。
这是本文选择的视觉方案,不是“夜读”的唯一正确表达。
生成前,先写一份最小创作要求。
| 决策 | 本例要求 | 如何检查 |
|---|---|---|
| 使用场景 | 竖版 4:5 活动海报背景 | 核对实际输出尺寸和最后使用的裁切。 |
| 核心信息 | 一处适合停下来阅读的夜间空间 | 请不知提示词的人描述图像在讲什么。 |
| 必须出现 | 一本打开的书、一盏台灯 | 检查数量和形态,排除多出来的书本或灯。 |
| 空间关系 | 书在中下部偏右,台灯在它左侧,窗在右上方 | 按画面左右检查,不使用含混的观察视角。 |
| 视觉主次 | 书页易于辨认;灯体与窗景只作辅助 | 比较完整图和小尺寸预览中的表现。 |
| 文字区域 | 左上方预留连续、较均匀的暗色区域 | 放入真实标题、日期与地点检查。 |
| 风格偏好 | 温暖室内光、克制的夜间冷色、自然材质 | 在前面的要求通过后,再比较氛围版本。 |
这张表应当先于提示词。
否则,看到第一张图后,你很容易把“模型已经画出来的东西”误当成自己原本的目标。
还要区分不可妥协的要求与可商量的偏好。在这个项目里,书必须完整、标题必须能放下;木桌究竟偏深棕还是浅棕,可以根据整体效果再决定。
Adobe 的构图教学强调,三分法、引导线等原则是辅助判断的工具,不是替代判断的公式。它也提醒摄影者在构图时预先考虑图片是否要叠加文字、用于封面等实际用途。 Adobe 构图教学
因此,本文不是因为“主体必须放在三分线上”才把书移向右下,而是为了让书、光源、窗景和标题得到各自的位置。
换成居中的书籍封面,合理的布局完全可能不同。
四、一份可直接练习的提示词
Google 的官方图像生成指南建议提供具体细节、交代图片用途,并通过小幅修改逐步迭代。 Google 图像生成指南
下面将这些写法用于本例。这份中文练习模板尚未逐字实跑;后面的场景示例使用另附的英文提示词。实际使用时,也要在工具支持的尺寸或比例设置中选择 4:5,并核对返回尺寸;不要只依赖提示词里的比例描述。
查看提示词收起提示词
为一家独立书店的夜读活动制作一张竖版 4:5 海报背景,不包含海报文字。
场景是一张夜间室内的木质书桌。画面中只有一本打开的书和一盏小型台灯,不出现人物或其他书本。
打开的书位于画面中下部偏右,完整保留书本外轮廓。温暖的光落在奶油色书页上,书页与桌面之间有清楚但自然的明暗分界。保留纸张和装订的合理细节,不生成可读的书页正文。
台灯位于书的左侧,灯体主要处于画面中下部,灯罩不要进入左上方的标题区域。保留可辨认的灯罩材质,避免灯罩成为一大块过曝白色。灯杆与书脊错开。
右上方只有一小片窗景,以少量低亮度、低饱和度的远处灯光说明夜晚,不出现醒目的霓虹招牌。窗框不贴住书的轮廓。
左上方预留连续、明暗较均匀的深色墙面,用于后续排入标题和活动信息。这一区域没有物件、窗框、明显纹理或强烈光斑。
整体安静、温暖,采用自然的室内摄影质感。以打开的书表达阅读主题,台灯和窗景提供环境线索,不与书争夺画面的重点。不生成标题、标志或其他可读文字。
这份提示词的关键,不是长度,而是每一段都有可以核对的职责:内容、位置、光线、轮廓、排版空间。
可以逐句追问:“这一句约束了成品中的什么?”如果无法回答,就考虑删去,或改成具体的视觉要求。
同样,不要加入互相打架的指令。例如,一边要求左上方是均匀的标题区,一边又要求全画面都有浓烈的光影、丰富纹理和城市细节。
风格要求也需要服从本次图片的用途。
如果你并不在意灯的具体造型,就没有必要写满它的材质、年代、品牌和零件。这里不是要求信息越少越好,而是把描述预算留给本次真正要控制的部分。
五、文字反复说不清时,改变输入方式
有些问题适合用语言说,有些问题更适合画出来。
“安静的夜晚”主要是语义与风格要求;“书应占据哪块区域、标题需要多大空间”,则可以先用二维版式表达。
对于本例,可以先在最终比例的画布上排入实际标题、日期和地点,再画出书、灯、窗的简单占位块。
确定相互位置后,隐藏文字,把这张布局图作为创作参照。本例提供无文字的 4:5 布局草图 PNG及可编辑 SVG。下载后,先确认上传工具接受对应格式。
草图中的占位块只负责说明位置和大致面积,不负责提供材质。使用时应明确说明:保留布局,不照搬占位块的颜色、辅助线或标签。普通图片参考能否准确跟随布局,需要看实际模型与结果;不能把上传草图当成坐标锁定功能。
ControlNet 的研究展示了另一类控制方式:在特定扩散模型架构中,通过边缘、深度、姿态等空间条件引导生成。这说明空间结构可以通过专门的条件通道表达,而不必全部依赖文字。 ControlNet 原论文
但这不意味着所有图片生成工具都采用 ControlNet,也不意味着普通参考图上传等同于使用这些空间条件。
本文建议的选择原则是:需要控制什么,就优先用能直接表达那件事的输入或编辑方式。
用途与情绪用语言说明;位置与占比用布局图说明;局部修改在工具支持时使用明确的区域控制;需要精确的文字、标志和坐标,则保留独立图层进行排版。
这是工作分配建议,不是要求每个项目都用齐所有工具。
只是灯罩太亮时,没有必要重建整套控制流程;但如果标题框必须精确到某个位置,也没有必要把最终排字押在反复生成上。
六、用四种视图检查同一张图
以下检查方法是本文提出的创作工作流,不是眼动实验,也不是自动化美学评分。

这张图有可辨认的书本轮廓和左上方的排版空间,但没有完全遵守要求:右侧书架出现了明确要求排除的其他书。两侧植物是未要求的新增内容,实际提交的提示词没有全面禁止植物,是否保留应根据项目需要判断。提示词要求 1280 × 1600,实际返回尺寸也不同。灯罩虽然保留了材质,却仍是醒目的暖色亮面;没有眼动测量,不能断言观看者必然先看哪里。
完整实际提交的英文提示词可查看或保存。生成工具没有向本次调用提供可核实的模型版本,因此不将图片归到某个具体型号。单张图只用来演示检查,不能说明一种写法通常有效或无效。
原尺寸:检查“有没有画对”
首先检查内容。
书是否仍然只有一本?打开的结构是否合理?灯杆、书脊和窗框是否产生了错误连接?重要部分有没有被裁掉?
在本图中,“不出现其他书本”这一项未通过。即使书店氛围合理,也不能在生成之后悄悄放宽原定要求。把这个问题记下来,再决定是否修图,或者由项目负责人明确修改简报。
使用尺寸:检查“还认不认得出”
把图片放到接近实际展示大小的环境里。活动列表里的小图、手机里的海报和桌面上的原图,应分别查看。
不要预设一个适合所有平台的缩略图尺寸。
这个练习的观察问题是:尺寸缩小后,打开的书还能否被辨认,还是只剩一盏亮灯和一片暗背景?
这不是要求主体永远更大。如果放大书会挤掉标题区,先考虑是否可以减少它附近的无关纹理,或者改善轮廓区分。
灰度副本:检查“明暗关系有没有问题”
临时去色,用来单独观察明暗组织。对于本例,可以比较书页、灯罩、窗景与桌面之间的关系,寻找是否存在一块过强的辅助亮面。
但灰度副本会移除色彩差异。
如果一张图本来主要靠颜色区分主次,去色后变得含混,并不证明原图失败。完成明暗诊断后,需要回到彩色图复核。
也不要把灰度图、模糊图或主观标注的“热点”包装成真实眼动热力图。
完整版式:检查“能不能交付”
放入本次活动真实使用的标题、日期与地点,检查文字边缘是否被背景纹理干扰、明暗变化是否穿过字形,以及裁切后信息是否完整。
这里还有一个容易忽略的变化:
背景图以书为主题,但最终海报完全可以让活动标题成为第一层信息。
加入文字后,应重新评估整张海报,而不是坚持背景图原来的主次不变。
例如先放入练习标题“今晚,读一本书”,再加入虚构活动信息“周五 19:30 · 阅读区”。这些是用于检查空间的练习文案,不是实际活动公告。本文示例尚未完成最终排字,也已经有数量约束未通过,因此不把它标为可交付成品。
七、根据错误类型决定下一次改什么
不要把所有不满意都翻译成“再高级一点”。
先定位问题,再决定输入、编辑或排版中哪一步需要调整。
| 观察到的问题 | 下一步优先处理 | 修改后必须复核 |
|---|---|---|
| 多出第二本书,或书本形态错误 | 对象数量与局部结构 | 位置和标题区域是否仍然保留。 |
| 灯罩比阅读内容更醒目 | 灯罩亮部与材质,而非全图提亮 | 书页是否被一并压暗,光源是否仍然合理。 |
| 窗外细节把主题带向城市夜景 | 窗景面积、亮度或细节密度 | 夜晚的环境线索是否仍然存在。 |
| 书页与桌面难以区分 | 两者的边界、局部明暗或遮挡 | 是否形成不自然的描边、光晕。 |
| 标题区域看似空,却难以排字 | 实际文字下方的纹理和亮度变化 | 文字在最终尺寸与裁切中是否清楚。 |
| 修改一个问题时,其他位置反复变化 | 返回保留版本,考虑局部控制或分层合成 | 已经确认的内容与布局是否被保住。 |
例如,假设只有灯罩的亮部有问题,可以将修改要求收窄为:
查看提示词收起提示词
只调整台灯灯罩的亮部:减弱过曝白色区域,恢复可辨认的灯罩材质,让灯罩不再成为画面中占据注意的大片亮面。
保留书的位置、大小、书页照明、窗的位置,以及左上方的标题区域。不要改变整体色调,不要增加物件。
这份修改说明尚未执行,不是“不变区域一定不会变化”的承诺。对本图而言,应先处理额外书本等不符合简报的内容,再决定是否调整灯罩。
因此,每次修改后都要同时记录两件事:目标问题是否改善,以及原本正确的地方是否退步。
只看改善、不看退步,很容易得到局部更好、整张却更难交付的结果。
还有一种情况值得提前接受:当错误涉及必须准确保留的商标、固定字形或产品结构时,保留已确认素材并进行合成,可以比继续要求模型重新绘制更适合项目。
这里追求的是交付条件,而不是“所有步骤必须由一次生成完成”。
八、做一次能积累经验的对照练习
单张结果可以说明“这次发生了什么”,不足以说明“这个写法通常更有效”。
GenEval 2 预印本指出,自动评价方法与人类判断的对应关系也可能随模型变化发生漂移。因此,既不能只凭一张选中的图总结规律,也不宜把自动评分当成永久可靠的裁判。 GenEval 2 预印本
下面是一个尚未执行的教学练习,用来初步检验一项修改方向。前面的单张场景图没有进入这组 A/B 练习。
问题:在同一场景要求中,增加明确的灯罩亮部约束,是否更容易得到适合阅读主题的构图?
先保留第四节的中文练习模板作为 B 版。A 版只删除这一句:
保留可辨认的灯罩材质,避免灯罩成为一大块过曝白色。
其他文本、参考图及其顺序、模型、尺寸和可见设置保持一致。
这比较的是“增加这条约束”的效果,不是比较长提示词与短提示词的总体优劣。
练习时可以先各生成 4 张,完整保留所有输出。这个数量只是教学预算示例,不能据此宣称统计显著或普遍有效。
若工具提供随机种子,可以记录并在同一版本、同一设置下采用配对种子;若不提供,就记录为“不可用”,不要填一个假设值。
这里固定的是其他输入条件,不是声称输出图片的其他像素也会保持不变。生成后的书、灯、窗都可能一起变化,这正是需要复核的部分。
在看结果之前,写好检查项:
物件数量与关系是否正确;灯罩是否出现大片失去材质的亮部;书在使用尺寸下能否被辨认;实际标题是否可以排入。
每张图分别记录“通过、未通过、不能判断”,并给出观察理由,不要只留下最好的一张。
若请别人协助评估,把版本名称隐藏、图片顺序打乱。可以问“这张图主要在讲什么”“哪些部分最引起你的注意”,不要先问“你是不是先看到了书”。
这些回答只是主观报告,不等于实际测得的第一注视点,更不能直接推断点击率或转化率。
用记录表整理本次项目的结论:
下载构图检查与对照练习记录表,逐张记录输入、观察与限制。表中保留“不能判断”,不要把不确定项自动算作通过。
只有实际填写这些记录之后,才适合把某种改法写成“本次观察到的效果”。
当模型、主题或使用场景变化时,也需要重新检查,而不是把旧经验当成固定规律。
把检查方法带到自己的项目
提示词负责表达要求,构图负责组织信息,验收负责判断结果是否完成任务。
下次遇到一张精致却不满意的 AI 图片,先不要继续叠加赞美性形容词。
问清楚:是对象和关系画错了,还是重点不符合预期,或者它放进真实版式后无法使用?
三类问题对应不同的改法,也需要不同的证据。
可复用的创作能力,不是记住某一串提示词,而是能够解释:这次要保留什么、改变什么,以及凭什么判断它确实变好了。
在 LocalBanana 中尝试时,从图片创作页面准备画面要求;选择比例和参考图的方法分别见宽高比指南与多参考图指南。本文不假设每个模型都有区域锁定或相同的可见设置,以你当前界面为准。



