对比评测12 分钟阅读
同一提示词,三个 AI 生图模型:2026 受控实测
把完全相同的人像、精确文字和角色三视图提示词交给 Banana Pro、GPT Image 2 与 Midjourney V8.2;每项只生成一次,并公开全部结果。

先说结论
2026 年 9 月 3 日,我们把 3 条完全不改写的英文提示词分别交给 Nano Banana Pro、GPT Image 2 与 Midjourney V8.2:一张写实人像、一张精确文字海报、一份三格角色设定。每个模型、每项任务只收第一次返回的图片,不靠反复抽卡把结果修饰得更好看。
这轮实测没有选出一位「全能冠军」,但给出了一套很好用的分流规则:
| 任务 | 本轮可见结果 | 实际选择建议 |
|---|---|---|
| 写实人像 | 三个模型都通过了本轮可见的硬条件核对,差别主要落在审美解释 | 别硬编能力分,直接比较你要哪种成片气质 |
| 精确文字海报 | GPT Image 整体执行最完整;Nano Banana Pro 保住文字与层级但裁掉了蓝方块左缘;Midjourney 则重排了行数和海报结构 | 版式不可改时先试 GPT Image;本轮 Nano Banana Pro 紧随其后 |
| 三格角色设定 | Nano Banana Pro 最贴近画格与道具要求;GPT Image 保住结构但多画了挎包;Midjourney 把设定表改成插画拼贴 | 网格本身就是规格时,先试 Nano Banana Pro |
一次实测是证据,不是排行榜
这是一轮 9 张图、每个模型每项任务只取 1 张的测试。它能证明这些具体成片里出现了什么,也能指出肉眼可见的失败;但它不能估算成功率、替未来版本排名,更不能推出某个模型永远更强。请把它当成上线前的分流测试,再用你的真实任务复跑。
如果你想先看更大的产品与语料背景,可以读《2026 AI 生图工具完整对比》。那篇衡量的是数千条图库提示词实际被派给谁;这一篇才是在输入被严格锁定后,看三个模型分别交出了什么。
方法:我们到底锁住了什么
本次运行 ID 为 20260903t073722z-514b0ccedd,入库清单哈希为 514b0cceddd25b65aff20462573dae0f5b7e19a2f0efcdd37c60c10f591783f7。计划中的 9 个任务全部成功完成。
| 变量 | 固定值 |
|---|---|
| 提示词 | 同一组三个模型收到完全相同的英文文本,不做模型专属改写 |
| 输入图片 | 无;三个任务都是纯文字生图 |
| 画幅 | 3:4 |
| Nano Banana Pro 路线 | APIMart gemini-3-pro-image-preview,1K |
| GPT Image 路线 | APIMart gpt-image-2-official,1K、中等质量、不透明背景 |
| Midjourney 路线 | APIMart Midjourney --v 8.2,relax 模式 |
| 选图规则 | 每条路线自动接受第一个返回的图片 URL,不人工挑图、不重跑 |
| 展示处理 | 不裁切,按比例放入 1200 × 1600 画布,再以 WebP quality 88 保存 |
这里有一个无法消除、但必须明说的不对称:每个 Midjourney 任务的接口响应暴露了 4 个候选 URL,另外两条路线各为 1 个。运行器自动采用 Midjourney 的第一个 URL,我们没有看完另外三张再挑最好的一张。三家原始文件尺寸也不同,所以下文只比较构图、文字和可见的指令遵循,不拿放大后的毛孔锐度做文章。
9 个任务从提交到完成分别落在 40.5–56.2 秒,其中包含供应商轮询。每条路线只有 3 次调用,而且服务机制不同,因此这些时间只留作复现记录,不用于下速度结论。
✕ 有偏测试
每个模型写一条不同提示词,反复抽到好看为止,再把最漂亮的那张叫作冠军✓ 受控测试
锁定任务、提示词、画幅、版本、选图规则和日期;先验收可见硬约束,再谈审美如果你也要设计一份公平的测试 brief,可以先用完整提示词工程指南,把主体、构图、光线和排除项拆开写清楚。
测试一:窗边写实编辑人像
原始提示词(未翻译、未改写)
Create a vertical 3:4 photoreal editorial portrait of a fictional adult woman in her late twenties, seated beside a large north-facing window in a quiet apartment. She wears a plain charcoal knit top, looks directly into the camera with a calm, self-possessed expression, and has natural skin texture with fine facial detail. Use soft overcast daylight, gentle shadow falloff, a 50 mm documentary perspective, eye-level framing, restrained neutral colors, and subtle fine grain. Keep the setting believable and uncluttered. No visible words, logos, branded objects, celebrity likeness, fantasy elements, beauty-filter skin, or decorative border.



三张图都交付了成年女性、窗边座姿、炭灰针织上衣、直视镜头和平静神情,也都没有可见文字、Logo 或装饰边框。按这些能直接核对的硬条件,本轮是平局。
差异落在「怎么拍」。Nano Banana Pro 拉开了景别,让安静的公寓也参与叙事,皮肤和日常细节最朴素;GPT Image 把镜头推近,面部与衣料更利落;Midjourney 给了最像选角大片的面孔、最干净的背景和更克制的美容编辑感。这些并没有天然高下:如果版面需要留文案空间,Nano Banana 的宽松取景更好用;如果脸就是资产,GPT Image 或 Midjourney 的紧凑构图可能更合适。
更重要的是,一张漂亮脸无法证明连续稳定性。真正做人像约束与参考图任务时,建议把这轮结果和角色一致性指南、Nano Banana vs Midjourney 对比一起看。

都市静影·人流穿梭
Nano Banana Pro提示词▾
一张极具电影质感的街头肖像,一位年轻女子静立于熙熙攘攘的城市街道,镜头清晰聚焦于她平静而专注的面部表情。长曝光效果使周围人群的移动形成强烈的方向性运动模糊,而主体则保持静止。柔和的自然日光,浅景深,奶油般的散景,逼真的肌肤纹理,淡淡的雀斑,自然的妆容,深色冬装外套和围巾。画面充满情感,引人深思,展现了都市叙事摄影的精髓,媲美单反相机的画质,85mm镜头视角,f/1.8光圈,高动态范围,8K分辨率,专业调色。

闪光主宰下的克制凝视
Nano Banana Pro提示词▾
使用参考图像。 严格保留人物身份与面部结构。 一位身形纤细的亚洲女性静止站立,身体状态是被刻意编排的,而非随意自然。 她的姿态带有明显的安排感与控制感,不显放松。 她正面面对镜头,肩线稳定,重心清晰且受控。 她的表情克制而冷静——不俏皮,也不甜美。 一个被控制的、极其微妙的微笑,带着情绪距离感。 她的目光稳定而清醒,直视镜头,呈现出安静的主导感,而非亲和或讨好。 手部与道具 右手握着一串垂落的金黄风铃花,位置经过刻意安排,仅作为视觉点缀 左手持有一束更大的金黄风铃花,略微下垂 花仅作为道具存在,绝不压过人物本身 人物始终是画面的绝对视觉中心 发型 长发,略带凌乱感的分层造型 头发被微风轻轻掀起,少量发丝掠过面部 气质偏摩登、略带性感,但始终受控——不凌乱,也不可爱 服装 白色复古风泡泡袖上衣 大体量泡泡袖 分层荷叶边袖口 方形领口 胸前抽绳形成柔和褶皱 略长衣身,覆盖臀部 前开衩设计,但克制不夸张 浅蓝色牛仔裤 彩色珠串项链作为轻微点缀 妆容 白皙肤色 抖音 + 韩系审美风格 卷翘睫毛 双颊与鼻尖淡粉色腮红 水润感粉橘色唇釉 整体妆感精致、有意识,不走可爱路线 指甲 白色法式指甲 低对比度的圣诞主题美甲装饰 环境 站立于一棵盛放的金黄风铃木(Thong Urai)前 树冠密集,充满饱和的金黄色花朵,形成高密度背景 少量花枝轻微遮挡画面上沿,制造柔和的前景虚化 背景的存在仅用于衬托人物,而非与人物竞争视觉焦点 光线(关键) 直闪作为绝对主光源 闪光明显压制环境光 皮肤呈现高亮状态,带轻微偏黄的闪光色调 人物身后形成清晰、硬边缘的阴影 自然光仅作为极弱的环境补光存在 光线用于强化人物与背景之间的分离感 摄影风格 紧凑型相机质感 富士 Pro 400H 胶片风格 复古镜头特性 轻微胶片颗粒 人物主体极度清晰 高亮曝光,强调人物主导地位 8K 分辨率 整体画面感觉是被精心导演与控制的,而非随拍或自然生成
测试二:精确文字编辑海报
原始提示词(未翻译、未改写)
Create a vertical 3:4 contemporary editorial poster on a warm off-white paper field. Set exactly the two-line headline "MAKE IDEAS" on line one and "VISIBLE" on line two, preserving spelling, capitalization, and word order. Use bold black grotesque lettering, a small cobalt-blue square, one thin vermilion rule, generous negative space, crisp alignment, and subtle printed-paper grain. The quoted headline must be the only readable text. Do not add a logo, signature, date, mockup frame, extra letters, or brand mark.



这一组很好地说明:「文字写对」远远不等于「设计做对」。
| 可见要求 | Nano Banana Pro | GPT Image 2 | Midjourney V8.2 |
|---|---|---|---|
| 拼写与大小写完全正确 | 通过 | 通过 | 通过 |
第一行完整保留 MAKE IDEAS | 通过 | 通过 | 未通过——拆成了两行 |
| 标题是唯一可读文字 | 通过 | 通过 | 通过 |
| 一个完整落在画面内的钴蓝方块 | 部分通过——左缘被裁掉 | 通过 | 通过 |
| 只有一条朱红横线,且无样机框架 | 通过 | 通过 | 未通过——多条横线,并呈现成被拍摄的纸张 |
GPT Image 完整通过 5 项检查。Nano Banana Pro 保住精确文字与层级,却因为蓝方块左缘被裁掉而丢了版式分。Midjourney 把每个字母都写对了——对于常被认为不擅长文字的模型,这是值得记录的进步——但它重新设计了信息层级。做情绪板时,这个解释可能很迷人;做一张行数已由品牌方签字的商业海报时,它就是生产失败。
因此,本轮只能支持一个窄而可靠的结论:精确字符与精确版式必须分开测。 校对拼写后,还要逐项核对换行、可数的图形元素、边距与禁加项。我们的AI 生图文字能力实测会把这张海报扩展为 12 张受控排版结果。
想找更多可复用的起点,可以先浏览 GPT Image 提示词与 Nano Banana 提示词,再换成你的最终文案。
测试三:同一位骑行员的三格设定
原始提示词(未翻译、未改写)
Create one vertical 3:4 character-consistency sheet divided into three equal horizontal panels. Every panel must show the same fictional adult bicycle courier: age thirty, oval face, short wavy black hair, small scar through the left eyebrow, mustard rain jacket, navy trousers, and a plain silver helmet with no markings. Panel one is a front-facing waist-up portrait, panel two is a left-facing side profile holding the helmet, and panel three is a full-body view beside a simple unbranded bicycle. Keep facial identity, hair, clothing colors, and body proportions consistent across all three panels. Use clean overcast daylight and a restrained pale-gray studio background. No captions, words, logos, celebrity likeness, or extra people.



Nano Banana Pro 对「这是一份什么文档」理解得最严格:三条等高横格,正面半身、手持头盔的左侧面,再到自行车旁的全身。脸、发型、夹克、长裤和头盔在整张设定表里能连成同一个人。不过眉毛处那条很小的疤没有清晰保住,因此最强结果也漏掉了一个身份锚点。
GPT Image 同样交付三条等高横格与指定镜头顺序,人物和服装相当统一,但它擅自增加了黑色挎包,眉疤也不够清楚。Midjourney 保住芥末黄与藏蓝配色,也画出了颇有完成度、身份大致连贯的骑行员插画;然而它把横向设定表改成了不对称漫画拼贴,第一格也不是严格的正面半身。
Midjourney 的成片还暴露了一个提示词问题:第三条 brief 规定了光线和背景,却没有像第一条那样明确写 photorealistic。插画并没有违反一个从未写下的媒介要求。媒介真的重要时,应把它作为独立硬约束锁住,不能指望模型从上一项任务「继承语境」。

电影照片故事板
Nano Banana Pro提示词▾
一张3x3的电影分镜脚本,由9个独立的分镜组成,呈网格状排列。画面描绘了一位有着铂金色头发的年轻女子,置身于冰天雪地的阿尔卑斯山冬季场景中。 这些面板展示了各种角度和镜头: 特写镜头:聚焦于她红润的脸颊、蓝灰色的眼睛和睫毛上的雪花。 中景镜头:她身穿黑色羊毛大衣,围着蓝色针织围巾,手捧一束白色干花。 广角镜头:捕捉她独自站在冰封的湖面上,背景是巍峨的雪山。 所有画面都呈现出一致的、略带忧郁的蓝调黄昏光线。高品质的胶片摄影美学,照片级真实感,8K分辨率,风格统一,色彩分级准确。
多格 AI 图片指南进一步拆解了画格语法、镜头顺序与属性锁定方法。
这轮测试如何改变选型
它让三个常见建议变得更精确:
- 人像先过约束,再按导演意图选。 三者都完成了可见硬条件,接下来真正要选的是环境纪实、精致写实,还是编辑大片感。
- 排版要把信息层级与拼写分开验收。 一张海报可以每个字都对,整张设计仍然不对。
- 角色设定先写文档结构,再写人物。 画格数量、方向、每格景别、媒介和禁加配件,都应进入硬约束区。
不要把这轮结果外推到未点名的模型版本或其他任务。版本会变,随机性真实存在,三条提示词也只覆盖三种生产形态。更稳妥的工作流是:先用这种小型对跑筛出两个候选,再把真正要交付的那份资产各跑一次。
你可以把上面的任意提示词复制到 LocalBanana 生成器里做一次新鲜复跑。如果更关心风格探索,Midjourney 提示词库会比假装这 9 张图已经终结所有争论更有用。
常见问题
这次实测到底哪个 AI 生图模型赢了?
没有模型包揽三项。写实人像的可见硬条件三者都通过;Nano Banana Pro 与 GPT Image 更严格地执行了海报版式;三格角色任务则由 Nano Banana Pro 最贴近 brief。这是按任务分流的结果,不是总榜排名。
三个模型拿到的真是完全相同的提示词吗?
是。同一项任务里,三条路线收到的英文提示词逐字节相同。我们没有翻译、缩写、手工追加 Midjourney 参数,也没有为任何模型另写优化版;差异只有记录在案的模型路线与各自原生参数。
图片有没有人工挑最好看的?
没有。运行器自动接受每条路线返回的第一个图片 URL,也没有重跑。Midjourney 返回中暴露了 4 个候选 URL,另外两条路线各 1 个;运行器直接采用第一个,而不是看完四张再挑冠军。
这能证明 Nano Banana Pro 比 GPT Image 2 或 Midjourney V8.2 更好吗?
不能。它只能证明 2026 年 9 月 3 日这 9 张具体成片里肉眼能看到什么。若要估算可靠胜率,需要为每项任务生成多个随机样本、增加任务类别、做盲评,并在版本更新后重复测试。
我该怎么做自己的公平对比?
先写验收项,再开始生成。锁定同一份提示词、输入图片、画幅、模型版本和选图规则;在任何重跑之前,先让所有路线各完成一次。先验收硬约束,最后才看审美,并保存日期与成片,让结论以后仍能复核。








