教程8 分钟阅读
AI 生图角色一致性完全指南
跨多次生成保住同一角色的三层方法:锚定描述、单变量原则、参考图——以及每一层各自在什么时候失效。

这篇解决什么问题
你做出了一个满意的角色。第二张图却是另一个人——发色对了,脸不对。这里没有可复用的 seed,也没有能保存角色的槽位,唯一能把身份从这次生成带到下次生成的东西,就是你粘贴进去的那段文字。
这篇讲的是跨多次生成保住同一个角色:今天出第一张,下周出第九张。如果你要的是一张图里排多个画格——六格表情表、分镜——那是另一套机制,见多格生成指南。下面所有内容都假设每次出图都是从零开始。
角色为什么会漂移
提示词不是记忆。每次生成都会从当次拿到的描述里重新推导出一张脸,因此你没写到的部分全部会被重新发明——而「一个长发黑发的年轻女性」几乎什么都没定死。
有三件事会让漂移变严重,按影响从大到小:
- 锚定描述太笼统。 你漏掉的每个形容词都是一个自由变量。「棕色头发」横跨六种色号和四种发型。
- 每次都换个说法。 每轮用自己的话重写一遍锚定描述,即使意思完全相同,出图也会变。这段文字就是你的 seed,请把它当字节看,不要当散文改。
- 一次改动超过一项。 姿势、服装、光线同时换,你就无法判断是哪一项让脸变了。
修法是三层,按顺序上。大多数人只用了第一层,然后得出「模型做不到」的结论。
第一层:锚定描述只写一次,之后原样粘贴
锚定块是一段固定的文字,只描述这个人,别的都不写。它绝不提场景、姿势、相机和情绪——那些每轮都要变,而凡是会变的东西都必须待在锚定块之外。这个切分就是全部诀窍。
一个能用的锚定块覆盖七个槽位:
| 槽位 | 差的写法 | 好的写法 |
|---|---|---|
| 年龄与体型 | 年轻女性 | 27 岁,168 cm,偏瘦但肩较宽 |
| 脸型 | 好看的脸 | 鹅蛋脸,方下颌,颧骨高 |
| 头发 | 棕色长发 | 及肩深栗色,齐刘海,微卷,左侧分 |
| 眼睛 | 漂亮的眼睛 | 眼距偏宽的榛色眼,下眼睑厚,眉浓且平 |
| 皮肤 | 白皮肤 | 暖橄榄色,鼻梁一片雀斑,右眼下方一颗小痣 |
| 标记物 | — | 只在左耳戴一只银色圆环耳环 |
| 服装 | 休闲装 | 米色罗纹针织衫,领口略松垮,一条细金链 |
标记物那一行是大家最爱跳过、却最起作用的一行。一个不对称的、不常见的细节——鼻中隔环、穿过一侧眉毛的疤、左右不成对的耳饰、只染一侧的一缕发——给了模型一个无法被平均掉的东西,也给了你一个一眼可查的东西。

优雅动漫女剑士 4 格设定图
GPT Image提示词▾
一张精致的动漫奇幻插画设定图,采用 2x2 网格布局,展示了同一位优雅女剑士的 4 个画面。角色为一位年轻女性,拥有一头极长的铂金白发,扎成高马尾并系有深海军蓝色的巨大蝴蝶结,发丝柔软卷曲且飘逸,皮肤白皙,五官精致细腻,双眸呈现明亮的红粉色。她身着华丽的白蓝配色哥特贵族裙装:带有蕾丝花边和金色刺绣的白色高领荷叶边衬衫,胸前饰有镶嵌红色宝石胸针的巨大海军蓝蝴蝶结,泡泡袖配有丝带袖口,深海军蓝色束腰紧身胸衣带有金色细节,蓬松的海军蓝色裙摆装饰着金色花纹、层叠的荷叶边,并带有缎面光泽。她携带一把带有深色剑柄和金色装饰的武士刀。第 1 格为胸部以上的特写肖像,身体微侧,在深色闪烁的夜空背景下,头发呈现出戏剧性的轮廓光。第 2 格为动态的上半身动作镜头,角色正横向拔剑或展示剑身,头发随风狂舞,背景为电影感的城市夜景虚化效果,周围环绕着发光的花瓣。第 3 格为全身时尚肖像,她优雅地站在高耸发光建筑环绕的明亮反光大厅中,展示了裙装的完整轮廓、带蝴蝶结的高跟鞋以及身侧的佩剑。第 4 格为日落或黎明时分在波光粼粼的海边拍摄的四分之三背影,角色回眸,背景是温暖的柔和色调天空和闪烁的水面,樱花花瓣随风飘落。采用超精细动漫渲染,轻小说封面级画质,细腻的织物纹理,光泽高光,金色装饰,柔和光晕,戏剧性背光,漂浮花瓣,闪烁粒子,优雅浪漫的氛围,以及海军蓝、白、金、淡粉色的和谐配色。

皮克斯质感Q萌贴纸系列
Nano Banana Pro提示词▾
一套可爱的3D Q版卡通女孩贴纸,同一个角色展现多种情绪和姿势。大而富有表现力的闪亮眼睛,柔和圆润的脸蛋,头部略大,身体比例娇小。浅棕色/金色凌乱丸子头发型,带有松散的发丝。身穿红色皮夹克内搭白色上衣。每个姿势展现不同的表情:惊讶、悲伤、困惑、开心、思考、眨眼、剪刀手、耸肩。受皮克斯/迪士尼灵感的3D渲染,光滑塑料质感,柔和光线,pastel米色背景。每个角色都有贴纸风格的白色描边,简洁极简美学,高细节,超级可爱,表情符号般的表情,高分辨率,工作室品质。
下面这块直接复制。填一次,存进一个文本文件,之后每条提示词里粘贴一模一样的字符。
[CHARACTER — do not edit between runs]
Name: Mara
Age and build: 27, 168 cm, slim with broad shoulders
Face: oval face, square jaw, high cheekbones, slightly asymmetric smile
Hair: shoulder-length dark chestnut, blunt fringe, slight wave, parted left
Eyes: wide-set hazel, heavy lower lids, thick straight brows
Skin: warm olive, freckles across the nose, small mole under the right eye
Marker: one silver hoop in the left ear only, none in the right
Wardrobe: cream ribbed knit, collar slightly stretched, thin gold chain
[SCENE — the only part that changes]
...
第二层:每次生成只改一件事
锚定块固定之后,第二层是关于「什么在变」的纪律。每轮只改一个变量:姿势,或地点,或服装,或光线——绝不同时两个。
✕ Bad
same girl as before, now in a cafe, wearing a red dress, sunset light, laughing, from a low angle✓ Good
[paste the identical CHARACTER block] SCENE: seated at a cafe window table, mid-morning, same cream knit as before, calm expression, eye level, 50mm. Everything about the character is unchanged from the previous image.另有两个习惯值得照抄。第一,在末尾显式声明哪些不许变——对人类读者是废话,对模型是承重结构。第二,如果角色比场景更重要,就用优先级词说出来:我们库里那些能撑住一整组的角色提示词,往往把身份放在最前面并标为最高约束,而不是埋在段落中间。

9宫格+裸感3D的玩法
Nano Banana Pro提示词▾
创建一张 2:3 纵向比例的时尚海报,画面中是 同一个女人、同一套服装, 以 9 种不同杂志编辑风格呈现,并带有 强烈的 3D 立体“跳出画面”效果。 人物一致性(最高优先级 · 严格) 9 个位置全部是同一个女性模特: 同一张脸、同样的五官结构 同样的肤色、体型 冷感美人气质: 清晰下颌线 高颧骨 克制、疏离、极简的编辑部表情 20 出头的中日韩系时尚模特脸 人物身份在 9 个画面中绝对不允许发生变化 服装一致性(新增硬规则) 9 个位置全部穿同一套衣服: 黑色羊绒 V 领宽松针织衫(略宽松版型) 高腰白色阔腿西装裤 黑色皮质乐福鞋,带低调金属马衔扣 低丸子头,前侧有自然凌乱碎发 小号金色圆环耳环 细金色项链 服装完全一致 仅允许变化:摄影风格、姿势、拍摄角度 背景层(Z=0)——3×3 九宫格结构(8 格可见) 网格结构与遮挡规则 标准 3×3 九宫格布局 中间格 [2,2] 必须被前景 3D 人物完全遮挡,不可见 每一格之间有 清晰可见的粗白色分割线(3–4px) 各杂志风格分布 [1,1] Vogue 编辑风 同一女人,同一套服装 姿势:站立,单手插兜,直视镜头 风格:高对比光影、戏剧性阴影、极致高级 面部清晰锐利 [1,2] Harper’s Bazaar 风格 侧脸回望 柔和、优雅的棚拍光 面部清晰 [1,3] ELLE 街拍风 行走状态,自信松弛 自然日光,都市时髦感 面部清晰 [2,1] i-D 杂志风 坐在极简立方体上,双腿交叠 大胆平面构图,彩色背景 面部清晰 [2,3] Dazed 风格 动态姿势,布料随动作流动 实验性角度,艺术编辑感 面部清晰 [3,1] Marie Claire 职场风 专业站姿,双臂交叉 干净、克制、中性色调 面部清晰 [3,2] GQ 极简风 倚靠墙面,松弛而优雅 建筑感构图,线条干净 面部清晰 [3,3] W Magazine 前卫风 艺术化姿态,手部动作夸张 高反差、先锋时装感 面部清晰 背景九宫格技术要求(硬性) 大景深 f/16 ❌ 不允许虚化 ❌ 不允许景深模糊 所有背景人脸 必须清晰对焦 均匀明亮棚拍光 白色网格线必须清楚可见 背景:明亮极简水泥或白色摄影棚 前景层(Z=向前 5–10cm)——超写实 3D 跳出人物 同一个女人 · 同一套服装 · 最戏剧化造型 超大比例全身人物 正中央位置 完全遮挡中间格 [2,2] 头部贴近画面最上边缘 鞋子贴近画面最下边缘 垂直占满画幅,制造强烈 3D 视觉冲击 姿势 向前行走的动态瞬间 自信步伐 手自然摆动或扶髋 正面直视镜头 从头到脚完整可见 3D 深度与遮挡逻辑 完全遮挡 中心格 [2,2] 100% 不可见 自然局部遮挡 上方 [1,2]:头发 / 头部侵入 10–15% 左侧 [2,1]:左臂侵入 15–20% 右侧 [2,3]:右臂侵入 15–20% 下方 [3,2]:腿部 / 鞋子侵入 10–15% 所有遮挡 必须自然突破白色网格线 边缘处理 柔和、有机过渡 ❌ 不允许硬切边 效果类似: 立体纸板人站在海报前方 光影与层次 阴影 人物向背景投射阴影 模糊:12px 颜色:rgba(0,0,0,0.25) 偏移:X=6px / Y=10px 脚部接触阴影 模糊:8px 颜色:rgba(0,0,0,0.35) 灯光 背景:均匀棚拍光 前景人物: 左上 45° 主光 轻微轮廓光 比背景更戏剧化 一致性铁律(绝对优先) 始终不变: 人脸 身份 年龄 发型 服装 配饰 只允许变化: 杂志风格 姿势 构图 摄影语言 禁止事项(严格) ❌ 不同女性 ❌ 不同服装 ❌ 模糊背景 ❌ 景深虚化 ❌ 网格不清晰 ❌ 低分辨率 ❌ 肢体畸形 ❌ 平面无 3D 感

不同服装风格的贴纸
Nano Banana Pro提示词▾
一个以上传照片为原型的3*3贴纸包,人物穿着不同服装和时尚风格。边缘干净裁剪,带有粗线条轮廓,姿势富有表现力,整体采用活泼的现代贴纸设计。在每个贴纸旁边采用中英文标注风格,所有贴纸保持相同的面部特征、一致的相似度和比例。 包含教师装、传统、护士制服、街头潮牌和奇幻灵感等多种服装风格。高分辨率成品,带有柔和阴影和光泽贴纸纸张质感,适合社交分享。
第三层:喂一张参考图
纯文字大约能把角色钉到「认得出是同一个人」这个级别。参考图能把它钉到同一张脸。只要你已经有一张满意的成图,之后每次生成都应该从它出发,而不是只从描述出发。
指令和上传本身同样重要。以下三种写法在我们库里反复出现,各自解决不同的问题:
- 严格身份锁——「Use reference image. Preserve identity and facial structure strictly.」用于换场景、换衣服、换光时必须保住脸。
- 禁风格化条款——「Preserve facial proportions, skin texture, expression and identity features with 100% accuracy. Do not stylise or alter facial features.」用于提示词其余部分要求了强烈画风、否则会把脸一起拽走的情况。
- 占位槽写法——把主体写成一个具名的参考标记,由上传图填充。适合同一套模板复用到不同的人身上。

闪光主宰下的克制凝视
Nano Banana Pro提示词▾
使用参考图像。 严格保留人物身份与面部结构。 一位身形纤细的亚洲女性静止站立,身体状态是被刻意编排的,而非随意自然。 她的姿态带有明显的安排感与控制感,不显放松。 她正面面对镜头,肩线稳定,重心清晰且受控。 她的表情克制而冷静——不俏皮,也不甜美。 一个被控制的、极其微妙的微笑,带着情绪距离感。 她的目光稳定而清醒,直视镜头,呈现出安静的主导感,而非亲和或讨好。 手部与道具 右手握着一串垂落的金黄风铃花,位置经过刻意安排,仅作为视觉点缀 左手持有一束更大的金黄风铃花,略微下垂 花仅作为道具存在,绝不压过人物本身 人物始终是画面的绝对视觉中心 发型 长发,略带凌乱感的分层造型 头发被微风轻轻掀起,少量发丝掠过面部 气质偏摩登、略带性感,但始终受控——不凌乱,也不可爱 服装 白色复古风泡泡袖上衣 大体量泡泡袖 分层荷叶边袖口 方形领口 胸前抽绳形成柔和褶皱 略长衣身,覆盖臀部 前开衩设计,但克制不夸张 浅蓝色牛仔裤 彩色珠串项链作为轻微点缀 妆容 白皙肤色 抖音 + 韩系审美风格 卷翘睫毛 双颊与鼻尖淡粉色腮红 水润感粉橘色唇釉 整体妆感精致、有意识,不走可爱路线 指甲 白色法式指甲 低对比度的圣诞主题美甲装饰 环境 站立于一棵盛放的金黄风铃木(Thong Urai)前 树冠密集,充满饱和的金黄色花朵,形成高密度背景 少量花枝轻微遮挡画面上沿,制造柔和的前景虚化 背景的存在仅用于衬托人物,而非与人物竞争视觉焦点 光线(关键) 直闪作为绝对主光源 闪光明显压制环境光 皮肤呈现高亮状态,带轻微偏黄的闪光色调 人物身后形成清晰、硬边缘的阴影 自然光仅作为极弱的环境补光存在 光线用于强化人物与背景之间的分离感 摄影风格 紧凑型相机质感 富士 Pro 400H 胶片风格 复古镜头特性 轻微胶片颗粒 人物主体极度清晰 高亮曝光,强调人物主导地位 8K 分辨率 整体画面感觉是被精心导演与控制的,而非随拍或自然生成

雪景下的精灵
Nano Banana Pro提示词▾
编辑级冬季海报风格的多面板拼贴画,具有自发的iPhone摄影美学(抓拍、温馨、写实)。柔和的雪花,细腻的模拟颗粒感,轻微的手持拍摄瑕疵。 参考遵循:请严格按照提供的照片进行面部参照,零偏差。以100%的准确度保留面部比例、皮肤纹理、表情和身份特征。不要对脸部特征进行风格化或改变。 一致性元素: - 主体服装:短款人造毛皮外套、黑色紧身裤、经典UGG靴子(简约、舒适、极具冬日气息) - 主要设备:银色iPhone 17 Pro Max,由主体在相关画面中持有 - 色彩调色板:温暖的琥珀色、柔和的红色、松树绿、柔和的冬日灰色 布局配置: 面板1(左上):黄昏时分的商店橱窗反光照片。淡淡的圣诞彩灯、花环、磨砂玻璃边缘、毛皮上的暖色调高光。主体拿着手机部分遮住脸部。掠过的轮廓、层叠的反射、柔和的重影、自然的玻璃曲率扭曲。 面板2(右上):超广角街景人像(雪中的人行道/圣诞市场)。近距离,向下倾斜的镜头角度。主体随意地向前倾,双手插在外套口袋里。黑色紧身裤和UGG靴子清晰可见。带有轻微运动模糊的飘雪。微妙的透视变形,以增强手持拍摄的真实感。 面板3(右下):亲密俯视自拍,温暖的街道或咖啡馆照明。手持外带节日饮品(咖啡或热红酒)。可见的有线耳机。清晰细腻的毛皮纹理和冬季面料。柔和的颗粒感增强怀旧的假日氛围。 图形叠加:极简Apple Music风格的迷你播放器,漂浮在拼贴画的中心,显示一首流行圣诞歌曲(例如,'Last Christmas' 或 'All I Want for Christmas Is You')。渲染效果平整干净,没有阴影。

一张图片生成9个不同景别的镜头
Nano Banana Pro提示词▾
<instruction> (指令) 分析输入图像的整个构图。识别所有存在的关键主体(无论是单人、群体/情侣、车辆还是特定物体)及其空间关系/互动。 生成一个连贯的 3x3 网格“电影印样(Contact Sheet)”,展示在同一环境中完全是这些主体的 9 个不同镜头。 你必须调整标准的电影镜头类型以适应内容(例如,如果是群体,保持群体在一起;如果是物体,构图包含整个物体): 第 1 行(建立背景): 大远景 (ELS): 主体在广阔的环境中显得很小。 全景 (LS): 完整的主体或群体从上到下可见(从头到脚 / 从车轮到车顶)。 中远景 (美式镜头/四分之三): 构图从膝盖以上(针对人物)或 3/4 视角(针对物体)。 第 2 行(核心覆盖): 4. 中景 (MS): 构图从腰部以上(或物体的中心核心)。聚焦于互动/动作。 5. 中特写 (MCU): 构图从胸部以上。主要主体的亲密构图。 6. 特写 (CU): 紧凑构图于脸部或物体的“正面”。 第 3 行(细节与角度): 7. 大特写 (ECU): 强烈聚焦于关键特征(眼睛、手、标志、纹理)的微距细节。 8. 低角度镜头 (仰视/虫眼): 从地面仰望主体(壮观/英雄感)。 9. 高角度镜头 (俯视/鸟瞰): 从上方俯瞰主体。 确保严格的一致性:所有 9 个面板中是相同的人物/物体、相同的衣服和相同的光照。景深应逼真地变化(特写镜头中的背景虚化)。 </instruction> 一个包含 9 个面板的专业 3x3 电影故事板网格。 该网格以全面的焦距范围展示输入图像中的特定主体/场景。 顶行: 宽广环境镜头,全视图,3/4 剪辑(膝上景)。 中间行: 腰部以上视图,胸部以上视图,脸部/正面特写。 底行: 微距细节,低角度,高角度。 所有帧均具有照片般逼真的纹理,一致的电影级调色,以及针对所分析的主体或物体特定数量的正确构图。

独立摇滚酷女孩闪光写真
Nano Banana Pro提示词▾
{
"portrait_prompt": {
"subject": "基于<用户肖像>,一位年轻女性,拥有蓬松凌乱的长发,穿着黑色运动短款上衣配白色滚边和配套黑色短裤,白色中筒袜。她坐在高高的深色木质柜台或钢琴顶上。她的姿势随意而前卫,身体前倾,一只手靠近嘴边,轻轻咬着手指,以慵懒漫不经心的表情直视镜头。手腕上戴着银手链。背景包括贴有复古海报的白墙和棕色木百叶窗。前景细节包括电吉他的琴颈、一罐曲奇饼干和酒瓶",
"composition": "全身照,35mm焦距,略低角度以强调腿部长度,主体锐利对焦配硬闪光衰减,凌乱但平衡的构图",
"camera_angle": "相对于坐姿主体的平视角度,从地板略低角度,中距离",
"lighting": "直接机顶闪光摄影,硬光在主体身后墙壁上产生锐利投影,高对比度,让人联想到90年代傻瓜相机美学,无柔光",
"color_palette": "复古胶片美学,Kodak Gold 200模拟,木百叶窗和家具的暖色调与冷白闪光灯形成对比,深黑色,略带颗粒感纹理,低保真独立氛围",
"mood": "独立颓废风,随拍,叛逆,酷女孩美学,原始真实,Y2K复古时尚编辑,快照风格",
"negative_prompt": "柔光,影棚灯光,虚化,专业影棚肖像,磨皮,3D渲染,卡通,插画,变形手部,缺失吉他弦,漂浮物体,解剖错误,僵硬姿势,过度处理,HDR"
}
}语料怎么说
统计自我们自己的图库:9,667 条已发布提示词,其中 9,599 条长于 20 字符,截至 2026 年 8 月。这些是使用频率,不是评测。
11.9%
的 Nano Banana 提示词基于参考图或上传图
GPT Image 5.1%,Midjourney 0.2%
4.8%
的 Nano Banana 提示词含一致性表述
GPT Image 4.2%,Midjourney 0.3%
9.4%
的全部提示词在要网格、多格或角色设定表
9,599 条里的 901 条
第一行的差距才是真正的故事。参考图驱动的写法在 Nano Banana 上是常规操作,在 Midjourney 上几乎不存在——4,249 条里只有 7 条——一致性措辞也是同样的分化。这是一种「哪里有效就在哪里被采纳、哪里无效就被放弃」的工作流。而「保住这个、只改那个」这类条件指令,正是 Nano Banana 在我们语料里拉开差距的地方,这也是图库里几乎每一组角色一致的作品都出自它的原因。模型侧的完整拆分见9,667 条提示词统计。
如果还是漂了,按这个顺序修
- 先看标记物。 如果那个不对称细节还在、脸却仍然不对,问题出在你的面部描述,不在模型。
- 从文件里重新粘一遍锚定块。 十次里有九次,是锚定描述在某处被你改写了。
- 退回到只改一个变量。 回到上一张成功的图,只改一件事。
- 把身份挪到最前并标为关键。 位置真的有影响,被埋起来的约束会被其他指令投票投掉。
- 加参考图。 最强的一根杠杆,也是「把角色最好的一张成图存在容易找到的地方」的理由。
- 降低要求。 一张图里九个姿势,比三张图各三个姿势更容易漂——每张脸能分到的像素是实打实的约束。

九宫格海马体精致写真
Nano Banana Pro提示词▾
杰作,最佳品质,照片级逼真,超高分辨率,色彩鲜艳,专业MV工作室摄影,3x3照片网格拼贴画。 一组九张同一位人物的精美肖像照:一位二十出头的绝世佳人,拥有迷人的双眼皮、无瑕的瓷白肌肤和一头浓密乌黑的波浪长发。她身着一袭优雅亮丽的红色抹胸礼服。 她的妆容完美无瑕,灵感来自韩国流行音乐视频:闪亮的眼影、精致的眼线和光泽渐变的唇妆。 每个网格单元格都捕捉到不同的富有魅力的表情和姿态: 1. **左上角:**拿着手机在镜头外自拍,露出甜美的、讨好粉丝的笑容。 2. **顶部中心:**俏皮地眨眨眼,闭上一只眼睛,露出迷人的微笑。 3. **右上角:**一个惊讶的表情,眼睛睁得大大的,嘴巴张成“O”形,看起来很可爱。 4. **左中:**一张可爱的嘟嘴脸,嘴唇撅起,头微微倾斜,展现出她的“撒娇”(可爱)。 5. **中间:**一个快乐、灿烂的笑容,眼睛眯成一条缝,散发着纯粹的幸福。 6. **中间偏右:**一张调皮的、皱着的脸,顽皮地皱着鼻子。 7. **左下角:**回头望去,俏皮地伸出舌尖。 8. **底部中心:**一张开怀大笑的照片,笑容灿烂地仰望着天空,仿佛捕捉到了一个真实的瞬间。 9. **右下角:**害羞、温柔的微笑,目光看向一旁,营造出“初恋”的感觉。 完美无瑕、明亮动感的影棚灯光,营造出高预算音乐录影带的拍摄效果。柔光箱打造干净的基础光,而柔和的主光则为她的肌肤和秀发增添层次感和迷人光泽。干净、无缝、纯色的浅灰色影棚背景,衬托出红色礼服的耀眼光芒。使用高端人像镜头(等效焦距 85mm f/1.2)拍摄,营造出柔美细腻的散景,使主体更加突出。色彩丰富饱满,礼服的鲜艳红色成为视觉焦点。整体氛围充满魅力、精致优雅,尽显明星风范。
写实的脸比风格化的脸更容易漂
一个赛璐璐上色、剪影独特的角色几乎怎么折腾都还认得出。而一张写实的脸有成千上万个微小自由度,每一个都会漂。如果你在做写实向,请预期必须上参考图而不只是文字——皮肤怎么才不会被磨成另一个人,见真实感指南。
可以直接起步的角色组
随便打开一条、复制提示词,然后只替换其中的角色块——这是看清「哪部分是锚定、哪部分是场景」最快的方法。更多在提示词库,也可以直接在生成器里跑。
常见问题
怎么让每张 AI 图里都是同一个角色?
写一段固定的角色块——年龄、体型、脸型、头发、眼睛、皮肤、一个不寻常的不对称标记物、服装——然后每次生成都粘贴一模一样的文字。每轮只改一件事,在结尾声明角色没有变化,并在你有了一张满意成图之后开始提供参考图。
为什么我的 AI 角色每次都变?
因为什么都没有被带过去。每次出图都会从描述里重新造一张脸,你没写的每个细节都成了自由变量。两轮之间换个说法重写描述,效果等同于把描述改了。
哪个模型的角色一致性最好?
在我们库里是 Nano Banana:11.9% 的提示词基于参考图,Midjourney 只有 0.2%;「保住这个、只改那个」这类条件指令是它最清晰的强项。如果角色设定表本身需要可读的标签或文字,GPT Image 更合适,可在 GPT Image 提示词专区浏览。
一定要参考图吗,还是纯文字够用?
纯文字能到「认得出是同一个人」——对风格化、插画类角色够用。写实人脸请直接规划上参考图。它是现有最强的一把锁,而且能把提示词的篇幅从描述骨相里解放出来,去写场景和光。它也是跨画风时唯一撑得住的东西:让新画风作用于所有地方,同时显式把面部比例和身份排除在外。
这和多格角色设定表有什么区别?
设定表解决的是一张图内部的一致性,模型能同时看到所有画格——那是更容易的问题,见多格生成指南。本页讲的是跨多次生成的一致性,那时模型除了你粘贴进去的文字之外什么都看不到。







