教程8 分钟阅读
多格 AI 图像生成:漫画、分镜与角色设定表
如何在一张图里得到 4/6/9 个画格且角色保持一致——提示词结构、能撑住的网格尺寸,以及漂移了怎么修。

一张图,多个画格
四格漫画。九宫格分镜。六种表情的角色设定表。3×3 产品网格。
它们向模型要的是同一件难事:在一张图里做出多个互不相同的画格,并让同一个主体在所有画格里保持一致。 这和生成一张好图是完全不同的问题,也是模型差距最锐利的地方——一个能把单张人像做得无可挑剔的模型,你要九格,它会痛快地给你九个不同的人。
这篇讲真正管用的做法:提示词怎么组织、哪些网格尺寸撑得住、以及它在哪里崩掉。
为什么难
单图提示词要的是观感。多格提示词要的是观感外加一条必须贯穿整张画布的规则:同一张脸、同一身衣服、同一种光,不同的姿势。
模型处理规则的稳定性不如处理氛围。常见的失败是漂移——第一格和第二格还对得上,第六格已经换了个人。多格提示词的全部功夫,就是让那条规则无法被忽略。
为什么这件事适合 Nano Banana
在我们的图库语料里,条件一致性正是 Nano Banana 与其他模型拉开差距的地方——和它能守住选择性保色、能在一组图里锁住同一角色是同一个原因。库里表现好的多格作品,几乎全部由它生成。
管用的结构
四个要素,按这个顺序。少任何一个,就是大多数尝试失败的地方。
- 用数字明确写出网格。 「6 格网格,2 行 × 3 列」胜过「若干画格」。模型需要的是数量,不是氛围。
- 在画格描述之前,把主体详细描述一次。 这是锚点。所有画格共享的东西——脸、发型、服装、年龄、体型——只写在这里,别处不写。
- 每个画格只给一个变量。 1:微笑。2:惊讶。如果某一格同时改了表情和机位和服装,漂移就是从那里开始的。
- 在结尾把不变项再钉一遍。 「所有画格中角色、服装、光线一致,全图艺术风格统一。」对人类读者是废话,对模型是承重结构。
[6 格网格,2 行 × 3 列,间距均匀]
[角色] 一位年轻女性,齐肩黑发,圆框眼镜,
米色针织毛衣,温暖的影棚光
[画格]
1. 无表情,正面朝向镜头
2. 大笑,头略偏
3. 惊讶,眉毛上扬
4. 沉思,手靠近下巴
5. 不悦,斜眼
6. 浅笑,闭眼
[一致性] 所有画格中角色、服装、光线完全一致。
全图插画风格统一。画格之间为干净的白色间隔。

皮克斯风·6格表情合集
Nano Banana Pro提示词▾
3D皮克斯风格动画年轻男性角色,以6格网格布局展示,每格呈现不同的面部表情和服装。明亮的纯色背景(黄、蓝、红、粉、紫、绿)。角色拥有柔软的棕色波浪卷发、富有表现力的大眼睛、光滑的皮肤和风格化的卡通比例。
各网格尺寸的成功率
以下是我们图库里实际撑得住的标准:
| 网格 | 稳定性 | 适用 |
|---|---|---|
| 2×2(4 格) | 最高 | 角色设定表、前后对比、季节套图 |
| 2×3 / 3×2(6 格) | 高 | 表情表、产品多角度 |
| 3×3(9 格) | 中等 | 分镜、贴纸表——要做好重跑准备 |
| 4×4(16 格) | 低 | 基本撑不住,拆成两张 8 格 |
现实上限在 9 格附近。再多,每格分到的像素就不足以让模型保住细节一致,脸开始飘。

一张图片生成9个不同景别的镜头
Nano Banana Pro提示词▾
<instruction> (指令) 分析输入图像的整个构图。识别所有存在的关键主体(无论是单人、群体/情侣、车辆还是特定物体)及其空间关系/互动。 生成一个连贯的 3x3 网格“电影印样(Contact Sheet)”,展示在同一环境中完全是这些主体的 9 个不同镜头。 你必须调整标准的电影镜头类型以适应内容(例如,如果是群体,保持群体在一起;如果是物体,构图包含整个物体): 第 1 行(建立背景): 大远景 (ELS): 主体在广阔的环境中显得很小。 全景 (LS): 完整的主体或群体从上到下可见(从头到脚 / 从车轮到车顶)。 中远景 (美式镜头/四分之三): 构图从膝盖以上(针对人物)或 3/4 视角(针对物体)。 第 2 行(核心覆盖): 4. 中景 (MS): 构图从腰部以上(或物体的中心核心)。聚焦于互动/动作。 5. 中特写 (MCU): 构图从胸部以上。主要主体的亲密构图。 6. 特写 (CU): 紧凑构图于脸部或物体的“正面”。 第 3 行(细节与角度): 7. 大特写 (ECU): 强烈聚焦于关键特征(眼睛、手、标志、纹理)的微距细节。 8. 低角度镜头 (仰视/虫眼): 从地面仰望主体(壮观/英雄感)。 9. 高角度镜头 (俯视/鸟瞰): 从上方俯瞰主体。 确保严格的一致性:所有 9 个面板中是相同的人物/物体、相同的衣服和相同的光照。景深应逼真地变化(特写镜头中的背景虚化)。 </instruction> 一个包含 9 个面板的专业 3x3 电影故事板网格。 该网格以全面的焦距范围展示输入图像中的特定主体/场景。 顶行: 宽广环境镜头,全视图,3/4 剪辑(膝上景)。 中间行: 腰部以上视图,胸部以上视图,脸部/正面特写。 底行: 微距细节,低角度,高角度。 所有帧均具有照片般逼真的纹理,一致的电影级调色,以及针对所分析的主体或物体特定数量的正确构图。
人们用它做的四件事
角色设定表。 同一角色的多个姿势或表情,用作参考或项目设定集。

猫耳学生会役員キャラクター設定資料集
GPT Image提示词▾
{
"type": "动画角色设定资料集",
"style": "精致的轻小说 / 视觉小说风格设计稿,白色背景配淡紫色装饰边框,高细节赛璐珞阴影,优雅的校园主题布局,柔和冷色调光影,清晰的线条",
"character": {
"name": "雾岛 澪奈",
"role": "严肃且带有黑猫特征的女性班长",
"age": "高中二年级学生",
"species traits": [
"头顶 2 只带有柔软内绒的黑猫耳朵",
"1 条长黑猫尾巴"
],
"appearance": {
"gender presentation": "女性",
"build": "纤细、优雅、曲线适中",
"height note": "在女学生中身材高挑",
"hair": {
"color": "深蓝黑色",
"style": "极长的直发,发梢微卷,中分刘海,长鬓角,后半部分扎成半马尾并系有丝带蝴蝶结"
},
"eyes": {
"color": "金琥珀色",
"shape": "锐利而优雅"
},
"expression base": "冷静、知性、内敛"
},
"outfit": {
"count": 9,
"pieces": [
"带有白色滚边的海军蓝校服西装",
"白色衬衫",
"海军蓝与酒红色相间的宽条纹丝带领结",
"胸前的校徽",
"印有日文“委员长”字样的红色袖标",
"蓝色格子百褶裙",
"黑色半透明连裤袜",
"黑色乐福鞋",
"细金框眼镜"
]
},
"props": {
"count": 1,
"items": [
"带有校徽的深色学校文件夹或笔记本"
]
}
},
"layout": {
"format": "横版角色设计项目",
"sections": [
{
"title": "个人资料",
"position": "左侧栏",
"count": 1,
"labels": ["个人简介文本框"]
},
{
"title": "侧面 / 背面",
"position": "上方中央",
"count": 3,
"labels": ["正面全身", "侧面全身", "背面全身"]
},
{
"title": "表情变化",
"position": "右上角",
"count": 8,
"labels": ["通常(认真)", "微笑", "提醒・责备", "惊讶", "害羞(移开视线)", "困扰", "温柔的笑容", "像猫一样撒娇"]
},
{
"title": "细节・配饰",
"position": "中右左侧面板",
"count": 5,
"labels": ["委员长袖标", "校徽", "猫咪主题发夹", "丝带领结", "细框眼镜"]
},
{
"title": "制服细节",
"position": "中右右侧面板",
"count": 3,
"labels": ["胸部与领结特写", "腰部与西装下摆特写", "袖口与纽扣特写"]
},
{
"title": "颜色调色板",
"position": "左下角",
"count": 5,
"labels": ["头发", "眼睛", "制服", "点缀色", "皮肤"]
},
{
"title": "标志性姿势・动作",
"position": "下方中央",
"count": 4,
"labels": ["下达指示(委员长模式)", "核对资料", "思考", "休息时的素颜(稍微放松的瞬间)"]
},
{
"title": "其他设定・要点",
"position": "右下角",
"count": 2,
"labels": ["教室场景", "月夜场景"]
}
]
},
"text blocks": {
"headline": "雾岛 澪奈",
"subheadline": "班长",
"quote": "为了大家,我必须做到完美。因为那是我的职责。",
"body text": "密集的日文个人资料,包含学年、生日、身高、血型、社团或委员会、性格备注、喜好与厌恶"
},
"composition notes": [
"左侧为主全身像,手持文件夹,眼镜靠近脸部",
"中央为角色侧面和背面的旋转图",
"所有肖像和特写均整齐地框在带有装饰性边角的淡紫色方框内",
"面部特写在肩部处裁剪",
"右下角的小插图展示了角色在教室和夜晚新月下的户外场景",
"整体色调为海军蓝、黑色、淡紫色、白色、酒红色、柔和金色和柔和肤色"
]
}分镜。 是序列不是集合。画格按顺序阅读,所以提示词里也该按节拍编号。

电影照片故事板
Nano Banana Pro提示词▾
一张3x3的电影分镜脚本,由9个独立的分镜组成,呈网格状排列。画面描绘了一位有着铂金色头发的年轻女子,置身于冰天雪地的阿尔卑斯山冬季场景中。 这些面板展示了各种角度和镜头: 特写镜头:聚焦于她红润的脸颊、蓝灰色的眼睛和睫毛上的雪花。 中景镜头:她身穿黑色羊毛大衣,围着蓝色针织围巾,手捧一束白色干花。 广角镜头:捕捉她独自站在冰封的湖面上,背景是巍峨的雪山。 所有画面都呈现出一致的、略带忧郁的蓝调黄昏光线。高品质的胶片摄影美学,照片级真实感,8K分辨率,风格统一,色彩分级准确。
产品网格。 同一件物品的多个角度或配色,为页面或商品详情排布。

3×3网格高端影棚产品故事板方案
Nano Banana Pro提示词▾
{"OverallLayout":{"Format":"3×3网格故事板,4:5比例画布上的九个相等面板","Style":"高端设计师模型,编辑精选,策展驱动,设计导向","Focus":"超越生活方式叙事的形式、构图、材质、视觉节奏","ProductConsistency":"完全相同的包装、品牌、材质、颜色、比例在所有九块面板中保持一致","ProductRecognition":"每一帧中产品都清晰可辨,标签/标志/比例不变"},"Frame1_HeroShot":{"Type":"正面英雄镜头","Set":"干净的工作室布景","Background":"中性、平衡构图","Product":"Nano Banana Pro包装居中","Lighting":"平静而自信的展示","Camera":"正面直拍角度"},"Frame2_CloseUp":{"Type":"中焦特写","Focus":"表面纹理与材质","Details":{"Texture":"哑光包装质感","Print":"清晰的香蕉插画细节","Seal":"可再封口拉链机制纹理","Branding":"标志字体与配色"},"DepthOfField":"浅景深,产品锐利聚焦"},"Frame3_BrandEnvironment":{"Type":"契合品牌的环境","Setting":"受包装色彩启发的工作室布景","Colors":"黄色香蕉调配合柔和绿色点缀","Props":{"Background":"柔和黄色背景配香蕉叶投影","Surface":"带微妙纹理的哑光白色桌面"}},"Camera&Style":{"Quality":"超高品质工作室图像,真实相机观感","ColorPalette":"柔和黄、白、绿香蕉调配哑光质感","Mood":"干净、现代、平易近人且高级"},"Output":{"Format":"3×3网格,无边框、无文字、无说明、无水印","Quality":"高分辨率、作品集就绪"}}编辑与贴纸套图。 时尚四分割、季节贴纸表、活动网格。

四格韩妆杂志特写
Nano Banana Pro提示词▾
美妆编辑拼贴,4格分屏网格布局,粗白色对角分割线。年轻女性呈现清洁女孩/韩妆美学。无瑕水润"玻璃肌"质感,高光泽度。浅棕色短发波波头配空气刘海,顺滑质感。柔和灰色/榛色美瞳。裸妆风格配颧骨高位柔和玫瑰腮红、亮泽粉色唇釉、自然蓬松眉毛。棕色千鸟格报童帽。精致小金蝴蝶耳钉,细金链项链。左上:3/4角特写,聚焦颧骨高光与耳环。右上:正面直视肖像,对称构图。左下:戴帽肖像,3/4侧转看镜头。右下:极致特写侧面轮廓。8K分辨率,柔和商业影棚灯光,眼中环形灯反射,去饱和背景,温暖肤色,高对比,高端美妆摄影。
漂移了,按这个顺序修
- 减少画格数。 九格改六格能解决大部分漂移。
- 把角色描述写得更具体。 「一位女性」会飘;「二十多岁末,方下颌,齐刘海齐肩黑发,银色圆环耳环」能撑住。
- 减少每格的变量。 如果每格同时改姿势和机位,就把机位全部固定。
- 重申不变项。 在结尾加一句「所有画格中面孔完全一致」,输出确实会不一样。
- 最后才上参考图。 喂一张人像作参考是最强的锁定手段,放弃之前值得一试。
不要在画格里要文字
把对话气泡和文案放进多格图,是最难的组合——你在同时要求版面一致性和文字渲染。先干净地生成画面,文字用任何编辑工具后期加。如果必须靠生成解决,那是 GPT Image 的活,不是 Nano Banana 的。
可以拿来起步的多格作品
✕ 只写剧情
侦探进屋、发现线索、离开的漫画条漫✓ 锁定格数与连续性
三个等宽竖格,每格都是同一名穿棕色外套的侦探;第 1 格进屋,第 2 格拿起红色钥匙,第 3 格拿着同一把钥匙离开;机位高度和光线固定常见问题
一张图最多能放几格?
4 格和 6 格是稳的,9 格能做但要做好重跑准备。超过 9 格,每格分到的分辨率不足以让模型保住细节,一致性会崩——拆成两张更划算。
怎么让每一格都是同一个角色?
在画格描述之前把角色用具体外形写一次,每格只给一个变量,结尾再明确写一句「所有画格中角色一致」。还飘就上参考图。
能用这个方法做带对话气泡的漫画吗?
画面不带文字生成,文字后期加——大多数人最后都是这么做的。要求一个模型同时保证画格一致性和可读文字,是这个领域里可靠性最低的请求。
哪个模型最擅长多格?
以我们图库为准是 Nano Banana——跨整张画布的条件一致性是它最明显的强项。如果画格里必须有可读文字,GPT Image 更合适。
该用什么画面比例?
跟着网格走:2×2 和 3×3 用 1:1,2×3 竖版用 4:5 或 3:4,横版分镜用 3:2。比例不匹配会把画格压扁,是细节丢失的常见原因。





