教程16 分钟阅读

AI 图片构图指南:从视觉层级到可验证的创作决策

结合视觉注意研究、夜读海报简报与保留缺陷的示例,分别检查 AI 图片的内容正确性、视觉主次与最终版式。

构图要从图片的用途出发:先写清必须保留的内容、主次与排版空间,再分别检查内容是否正确、重点是否清楚、成品是否可用。

为什么画面已经很精致,主题却仍然不清楚?

假设你正在为一家独立书店制作夜读活动海报。

你输入“打开的书、温暖的台灯、夜晚、电影感、精致细节”,得到了一张漂亮的图:灯罩发光,窗外有层次丰富的城市灯影,桌面木纹也很真实。

但你真正想讲的是“今晚,来这里读一本书”。

如果画面更像台灯广告,或者标题只能压在复杂的窗框上,那么问题就不是细节不够,而是画面没有把创作目的组织起来。

本文把构图作为一项可以规划、检查和修改的工作:既决定物体放在哪里,也决定哪些信息应该突出、哪些信息只需支持主题。

核心方法是:先明确图片要完成的任务,再把要求写成可观察的关系,最后对着成品逐项验收。

本文将视觉研究转化为创作检查方法。图解由编辑绘制,场景图由 OpenAI 图像生成工具制作,保留了未满足要求的细节;没有在 LocalBanana 运行生成,也不报告模型成功率。文末对照练习尚未执行。

一、先分清:内容正确、重点清楚、成品可用

评价一张 AI 图片时,不要急着给它一个综合分数。

对于有明确用途的创作,本文建议分开回答三个问题。

检查层要回答的问题夜读海报中的例子
内容正确对象、数量、属性和关系是否符合要求?只有一本打开的书;台灯在书的左侧;书没有变成两本重叠的本子。
重点清楚画面强调的信息,是否与创作意图一致?书页和阅读空间能够被辨认;窗外灯光没有把主题变成城市夜景。
成品可用放进实际版式后,图片能否完成任务?标题、日期可以清楚排入;实际裁切没有损伤书的关键轮廓。

这是本文的项目检查表,不是通用的美学评分体系。

图文一致性研究也提醒我们,需要把“是否画对”作为独立问题。TIFA 将提示词拆成可回答的问题,再检查图像是否符合描述;它研究的是忠实度,而不是一张海报是否完成了传播任务。 TIFA 原论文

因此,不要让“整体很好看”替一个关键错误开脱。对于这个项目,少了一本必须出现的书、标题放不下,或者活动日期写错,都不能靠更好的光影抵消。

同样,视觉层级不是要求每张作品只能有一个兴趣点。本文采用明确主次,是因为这个海报练习需要清楚传达活动主题。多中心叙事、刻意的混乱和视觉谜题,也可以是合理的创作目标。

二、理解构图,需要三条有边界的理论线索

1. 视觉显著性解释“哪里突出”,不能单独解释“人会看什么”

Itti、Koch 与 Niebur 的经典研究将多尺度视觉特征整合成显著性图,用于预测值得优先处理的图像位置。它为从图像差异理解注意分配提供了一种计算模型。 Itti、Koch 与 Niebur,1998

但人并不只是响应亮度和边缘。

Henderson 与 Hayes 的场景观看研究发现,区域的语义信息也能解释注视分布;后续研究对“意义地图”能否独立测量语义贡献提出了质疑,原作者则回应了地图的测量目标。具体机制与测量方式仍有争论。这里更稳妥的结论是:不能把观看行为简化成一个最亮区域规则。 原研究后续质疑作者回应

转化到本例,创作时可以提出一个需要检验的判断:

如果书是主题,就应同时检查书本身是否容易识别,以及其他区域是否提供了过强、却与主题无关的视觉刺激。

假设窗外多出一块抢眼的霓虹招牌,下一步未必是让整本书更亮。也可以先减弱那块招牌的亮度、色彩或细节。

两种操作的区别在于:前者继续强化主体,后者减少竞争。你需要对照具体画面,决定哪一种更合适,而不是把所有地方一起加对比度。

这里讨论的是人类观看图像时的注意。它与生成模型内部被称为 attention 的计算机制不是同一个概念,也不能由此推出某个模型必然如何理解提示词。

2. 主体不仅要出现,还要能从周围被辨认出来

Wagemans 等人的综述区分了知觉分组与图形—背景组织:我们不仅识别局部元素,也会组织哪些部分属于同一对象、轮廓属于哪一侧,以及表面之间的关系。 Wagemans 等,2012

本文据此建议增加一项很具体的构图检查:

关键轮廓有没有被周围的颜色、线条或遮挡弄得含混?

两幅轮廓示意:上方灯杆延长线与书脊重合,下方把灯杆错开,让两件物体更容易区分。
轮廓关系示意,不是生成前后对照。只移动台灯的位置,说明需要检查的视觉连接;它不预测模型能否执行修改。

在夜读海报中,可以检查书页外沿有没有与桌面融成一片,灯杆是否刚好沿着书脊重叠,窗框是否贴住书的边缘,让两个无关物体看起来像一个结构。

需要修正时,试着描述问题所在的关系:

让书页外沿与桌面保留可辨认的明暗分界;灯杆与书脊错开;不要让窗框紧贴书的外轮廓。

这比“主体更突出”更容易在结果中核对。它仍然是创作指令,不是边缘必定准确保留的技术保证。

也不必把每一段轮廓都描得很硬。这个练习的目标是让书容易辨认,不是消除所有遮挡、柔边和氛围。

3. 画出了所有名词,不等于画对了它们的关系

T2I-CompBench 将组合生成拆成属性绑定、对象关系和复杂组合等类别。这里的“组合”指概念和文本要求是否被正确组合,不等于美术意义上的构图质量。

例如,“黄色台灯旁边有一本蓝色封面的书”,不仅要求出现台灯和书,还要求颜色属于正确对象、空间关系符合描述。 T2I-CompBench,2023 原版

这对创作者的启发是:把提示词从物件清单,改写成关系说明。

“书、台灯、夜景、温暖”只列出了构成元素;“台灯在书左侧,光落在打开的书页上,夜景限制在右上方的小窗内”,进一步交代了这些元素如何共同构成画面。

不要把早期研究中某个模型的表现直接套给所有新模型。这里借用的是研究对问题的拆分方式,而不是把旧榜单当成今天的能力上限。

三、把“高级、治愈、有电影感”变成可执行的创作要求

情绪词可以保留,但不要让它们独自承担构图任务。

在这个练习里,我们对“安静的夜读”作出如下解释:

书页形成主要的可辨认亮面;台灯负责说明光源;窗外只提供夜晚的环境线索;画面还必须容纳活动文字。

这是本文选择的视觉方案,不是“夜读”的唯一正确表达。

生成前,先写一份最小创作要求。

决策本例要求如何检查
使用场景竖版 4:5 活动海报背景核对实际输出尺寸和最后使用的裁切。
核心信息一处适合停下来阅读的夜间空间请不知提示词的人描述图像在讲什么。
必须出现一本打开的书、一盏台灯检查数量和形态,排除多出来的书本或灯。
空间关系书在中下部偏右,台灯在它左侧,窗在右上方按画面左右检查,不使用含混的观察视角。
视觉主次书页易于辨认;灯体与窗景只作辅助比较完整图和小尺寸预览中的表现。
文字区域左上方预留连续、较均匀的暗色区域放入真实标题、日期与地点检查。
风格偏好温暖室内光、克制的夜间冷色、自然材质在前面的要求通过后,再比较氛围版本。
4:5 海报布局示意:左上为标题区,右上小窗,左下台灯,中下偏右是书。
编辑绘制的布局草图。方块和简化轮廓只说明位置与面积,不是成片;标题区的可用性仍须放入实际文字检验。

这张表应当先于提示词。

否则,看到第一张图后,你很容易把“模型已经画出来的东西”误当成自己原本的目标。

还要区分不可妥协的要求与可商量的偏好。在这个项目里,书必须完整、标题必须能放下;木桌究竟偏深棕还是浅棕,可以根据整体效果再决定。

Adobe 的构图教学强调,三分法、引导线等原则是辅助判断的工具,不是替代判断的公式。它也提醒摄影者在构图时预先考虑图片是否要叠加文字、用于封面等实际用途。 Adobe 构图教学

因此,本文不是因为“主体必须放在三分线上”才把书移向右下,而是为了让书、光源、窗景和标题得到各自的位置。

换成居中的书籍封面,合理的布局完全可能不同。

四、一份可直接练习的提示词

Google 的官方图像生成指南建议提供具体细节、交代图片用途,并通过小幅修改逐步迭代。 Google 图像生成指南

下面将这些写法用于本例。这份中文练习模板尚未逐字实跑;后面的场景示例使用另附的英文提示词。实际使用时,也要在工具支持的尺寸或比例设置中选择 4:5,并核对返回尺寸;不要只依赖提示词里的比例描述。

查看提示词收起提示词
为一家独立书店的夜读活动制作一张竖版 4:5 海报背景,不包含海报文字。

场景是一张夜间室内的木质书桌。画面中只有一本打开的书和一盏小型台灯,不出现人物或其他书本。

打开的书位于画面中下部偏右,完整保留书本外轮廓。温暖的光落在奶油色书页上,书页与桌面之间有清楚但自然的明暗分界。保留纸张和装订的合理细节,不生成可读的书页正文。

台灯位于书的左侧,灯体主要处于画面中下部,灯罩不要进入左上方的标题区域。保留可辨认的灯罩材质,避免灯罩成为一大块过曝白色。灯杆与书脊错开。

右上方只有一小片窗景,以少量低亮度、低饱和度的远处灯光说明夜晚,不出现醒目的霓虹招牌。窗框不贴住书的轮廓。

左上方预留连续、明暗较均匀的深色墙面,用于后续排入标题和活动信息。这一区域没有物件、窗框、明显纹理或强烈光斑。

整体安静、温暖,采用自然的室内摄影质感。以打开的书表达阅读主题,台灯和窗景提供环境线索,不与书争夺画面的重点。不生成标题、标志或其他可读文字。

这份提示词的关键,不是长度,而是每一段都有可以核对的职责:内容、位置、光线、轮廓、排版空间。

可以逐句追问:“这一句约束了成品中的什么?”如果无法回答,就考虑删去,或改成具体的视觉要求。

同样,不要加入互相打架的指令。例如,一边要求左上方是均匀的标题区,一边又要求全画面都有浓烈的光影、丰富纹理和城市细节。

风格要求也需要服从本次图片的用途。

如果你并不在意灯的具体造型,就没有必要写满它的材质、年代、品牌和零件。这里不是要求信息越少越好,而是把描述预算留给本次真正要控制的部分。

五、文字反复说不清时,改变输入方式

有些问题适合用语言说,有些问题更适合画出来。

“安静的夜晚”主要是语义与风格要求;“书应占据哪块区域、标题需要多大空间”,则可以先用二维版式表达。

对于本例,可以先在最终比例的画布上排入实际标题、日期和地点,再画出书、灯、窗的简单占位块。

确定相互位置后,隐藏文字,把这张布局图作为创作参照。本例提供无文字的 4:5 布局草图 PNG可编辑 SVG。下载后,先确认上传工具接受对应格式。

草图中的占位块只负责说明位置和大致面积,不负责提供材质。使用时应明确说明:保留布局,不照搬占位块的颜色、辅助线或标签。普通图片参考能否准确跟随布局,需要看实际模型与结果;不能把上传草图当成坐标锁定功能。

ControlNet 的研究展示了另一类控制方式:在特定扩散模型架构中,通过边缘、深度、姿态等空间条件引导生成。这说明空间结构可以通过专门的条件通道表达,而不必全部依赖文字。 ControlNet 原论文

但这不意味着所有图片生成工具都采用 ControlNet,也不意味着普通参考图上传等同于使用这些空间条件。

本文建议的选择原则是:需要控制什么,就优先用能直接表达那件事的输入或编辑方式。

用途与情绪用语言说明;位置与占比用布局图说明;局部修改在工具支持时使用明确的区域控制;需要精确的文字、标志和坐标,则保留独立图层进行排版。

这是工作分配建议,不是要求每个项目都用齐所有工具。

只是灯罩太亮时,没有必要重建整套控制流程;但如果标题框必须精确到某个位置,也没有必要把最终排字押在反复生成上。

六、用四种视图检查同一张图

以下检查方法是本文提出的创作工作流,不是眼动实验,也不是自动化美学评分。

夜间桌面上有一本打开的书和左侧台灯,左上墙面较空,右侧却多出装着其他书的书架,两侧还有植物。
为本文生成的一张教学示例,2026 年 9 月 20 日由 OpenAI 图像生成工具返回;实际尺寸 1122 × 1402,近似 4:5。只生成一次,保留全部画面,无修补、裁切或调色,不是 LocalBanana 模型实测。

这张图有可辨认的书本轮廓和左上方的排版空间,但没有完全遵守要求:右侧书架出现了明确要求排除的其他书。两侧植物是未要求的新增内容,实际提交的提示词没有全面禁止植物,是否保留应根据项目需要判断。提示词要求 1280 × 1600,实际返回尺寸也不同。灯罩虽然保留了材质,却仍是醒目的暖色亮面;没有眼动测量,不能断言观看者必然先看哪里。

完整实际提交的英文提示词可查看或保存。生成工具没有向本次调用提供可核实的模型版本,因此不将图片归到某个具体型号。单张图只用来演示检查,不能说明一种写法通常有效或无效。

原尺寸:检查“有没有画对”

首先检查内容。

书是否仍然只有一本?打开的结构是否合理?灯杆、书脊和窗框是否产生了错误连接?重要部分有没有被裁掉?

在本图中,“不出现其他书本”这一项未通过。即使书店氛围合理,也不能在生成之后悄悄放宽原定要求。把这个问题记下来,再决定是否修图,或者由项目负责人明确修改简报。

使用尺寸:检查“还认不认得出”

把图片放到接近实际展示大小的环境里。活动列表里的小图、手机里的海报和桌面上的原图,应分别查看。

不要预设一个适合所有平台的缩略图尺寸。

这个练习的观察问题是:尺寸缩小后,打开的书还能否被辨认,还是只剩一盏亮灯和一片暗背景?

这不是要求主体永远更大。如果放大书会挤掉标题区,先考虑是否可以减少它附近的无关纹理,或者改善轮廓区分。

灰度副本:检查“明暗关系有没有问题”

临时去色,用来单独观察明暗组织。对于本例,可以比较书页、灯罩、窗景与桌面之间的关系,寻找是否存在一块过强的辅助亮面。

但灰度副本会移除色彩差异。

如果一张图本来主要靠颜色区分主次,去色后变得含混,并不证明原图失败。完成明暗诊断后,需要回到彩色图复核。

也不要把灰度图、模糊图或主观标注的“热点”包装成真实眼动热力图。

完整版式:检查“能不能交付”

放入本次活动真实使用的标题、日期与地点,检查文字边缘是否被背景纹理干扰、明暗变化是否穿过字形,以及裁切后信息是否完整。

这里还有一个容易忽略的变化:

背景图以书为主题,但最终海报完全可以让活动标题成为第一层信息。

加入文字后,应重新评估整张海报,而不是坚持背景图原来的主次不变。

例如先放入练习标题“今晚,读一本书”,再加入虚构活动信息“周五 19:30 · 阅读区”。这些是用于检查空间的练习文案,不是实际活动公告。本文示例尚未完成最终排字,也已经有数量约束未通过,因此不把它标为可交付成品。

七、根据错误类型决定下一次改什么

不要把所有不满意都翻译成“再高级一点”。

先定位问题,再决定输入、编辑或排版中哪一步需要调整。

观察到的问题下一步优先处理修改后必须复核
多出第二本书,或书本形态错误对象数量与局部结构位置和标题区域是否仍然保留。
灯罩比阅读内容更醒目灯罩亮部与材质,而非全图提亮书页是否被一并压暗,光源是否仍然合理。
窗外细节把主题带向城市夜景窗景面积、亮度或细节密度夜晚的环境线索是否仍然存在。
书页与桌面难以区分两者的边界、局部明暗或遮挡是否形成不自然的描边、光晕。
标题区域看似空,却难以排字实际文字下方的纹理和亮度变化文字在最终尺寸与裁切中是否清楚。
修改一个问题时,其他位置反复变化返回保留版本,考虑局部控制或分层合成已经确认的内容与布局是否被保住。

例如,假设只有灯罩的亮部有问题,可以将修改要求收窄为:

查看提示词收起提示词
只调整台灯灯罩的亮部:减弱过曝白色区域,恢复可辨认的灯罩材质,让灯罩不再成为画面中占据注意的大片亮面。

保留书的位置、大小、书页照明、窗的位置,以及左上方的标题区域。不要改变整体色调,不要增加物件。

这份修改说明尚未执行,不是“不变区域一定不会变化”的承诺。对本图而言,应先处理额外书本等不符合简报的内容,再决定是否调整灯罩。

因此,每次修改后都要同时记录两件事:目标问题是否改善,以及原本正确的地方是否退步。

只看改善、不看退步,很容易得到局部更好、整张却更难交付的结果。

还有一种情况值得提前接受:当错误涉及必须准确保留的商标、固定字形或产品结构时,保留已确认素材并进行合成,可以比继续要求模型重新绘制更适合项目。

这里追求的是交付条件,而不是“所有步骤必须由一次生成完成”。

八、做一次能积累经验的对照练习

单张结果可以说明“这次发生了什么”,不足以说明“这个写法通常更有效”。

GenEval 2 预印本指出,自动评价方法与人类判断的对应关系也可能随模型变化发生漂移。因此,既不能只凭一张选中的图总结规律,也不宜把自动评分当成永久可靠的裁判。 GenEval 2 预印本

下面是一个尚未执行的教学练习,用来初步检验一项修改方向。前面的单张场景图没有进入这组 A/B 练习。

问题:在同一场景要求中,增加明确的灯罩亮部约束,是否更容易得到适合阅读主题的构图?

先保留第四节的中文练习模板作为 B 版。A 版只删除这一句:

保留可辨认的灯罩材质,避免灯罩成为一大块过曝白色。

其他文本、参考图及其顺序、模型、尺寸和可见设置保持一致。

这比较的是“增加这条约束”的效果,不是比较长提示词与短提示词的总体优劣。

练习时可以先各生成 4 张,完整保留所有输出。这个数量只是教学预算示例,不能据此宣称统计显著或普遍有效。

若工具提供随机种子,可以记录并在同一版本、同一设置下采用配对种子;若不提供,就记录为“不可用”,不要填一个假设值。

这里固定的是其他输入条件,不是声称输出图片的其他像素也会保持不变。生成后的书、灯、窗都可能一起变化,这正是需要复核的部分。

在看结果之前,写好检查项:

物件数量与关系是否正确;灯罩是否出现大片失去材质的亮部;书在使用尺寸下能否被辨认;实际标题是否可以排入。

每张图分别记录“通过、未通过、不能判断”,并给出观察理由,不要只留下最好的一张。

若请别人协助评估,把版本名称隐藏、图片顺序打乱。可以问“这张图主要在讲什么”“哪些部分最引起你的注意”,不要先问“你是不是先看到了书”。

这些回答只是主观报告,不等于实际测得的第一注视点,更不能直接推断点击率或转化率。

用记录表整理本次项目的结论:

下载构图检查与对照练习记录表,逐张记录输入、观察与限制。表中保留“不能判断”,不要把不确定项自动算作通过。

只有实际填写这些记录之后,才适合把某种改法写成“本次观察到的效果”。

当模型、主题或使用场景变化时,也需要重新检查,而不是把旧经验当成固定规律。

把检查方法带到自己的项目

提示词负责表达要求,构图负责组织信息,验收负责判断结果是否完成任务。

下次遇到一张精致却不满意的 AI 图片,先不要继续叠加赞美性形容词。

问清楚:是对象和关系画错了,还是重点不符合预期,或者它放进真实版式后无法使用?

三类问题对应不同的改法,也需要不同的证据。

可复用的创作能力,不是记住某一串提示词,而是能够解释:这次要保留什么、改变什么,以及凭什么判断它确实变好了。

在 LocalBanana 中尝试时,从图片创作页面准备画面要求;选择比例和参考图的方法分别见宽高比指南多参考图指南。本文不假设每个模型都有区域锁定或相同的可见设置,以你当前界面为准。

LocalBanana Team@LocalBanana_io更新于

继续阅读

查看全部