用 AI 生图模型做信息图:205 条提示词拆解
九种版式覆盖全部语料。有效的提示词写明轴线、写出数量、给每个标签加引号——对 205 条信息图提示词的测量。

本页目录
信息图提示词要做到的,照片提示词不用做
信息图提示词的失败方式和人像提示词不一样。图可以很漂亮,但依然是错的——步骤数不对、标注线指向空处、标题里有错字。我们取出 LocalBanana 图库里所有要求信息图、图解、剖面、爆炸视图或流程图的 205 条提示词——截至 2026 年 9 月 7 日,占 11,763 条有效提示词的 1.7%——测量那些成功的提示词如何处理版式、文字和数量。
205
占图库语料 1.7%,是我们测过的最小品类
186
正好是全站中位数 93 的两倍
37
整体语料是 12——是典型条目互动量的三倍
九种版式几乎覆盖全部
信息图提示词不是自由发挥。几乎每一条都在要求一种可识别的版式,九种版式覆盖了整个语料。各版式被要求的提示词占比:
| 版式 | 占信息图提示词比例 |
|---|---|
| 标注、标签或指示箭头 | 61.0% |
| 网格或分格 | 42.9% |
| 部件或食材分开摆放 | 40.5% |
| 流程、步骤或流程图 | 22.0% |
| 立体模型或微缩 3D 场景 | 16.6% |
| 剖面或横截面 | 13.7% |
| 规格表、目录页或蓝图 | 12.2% |
| 对比或前后变化 | 10.7% |
| 等距视角 | 8.8% |
| 爆炸视图 | 7.8% |
| 时间线 | 7.8% |
五分之三的提示词要求标注。标注是让一张图成为信息图而不是插画的东西——一根从标签指向部件的线——也是模型最常出错的地方,因为标注必须指向某个具体的东西。标注干净的提示词有一个共同习惯:说明有几个,说明在哪一侧。
按主题看,32.7% 的信息图提示词关于产品或机器,25.4% 关于科学或教育话题,16.6% 是食谱,8.8% 是商业路线图或组织架构。食谱是小品类里成绩最突出的:浏览量中位数 155,是信息图中位数的四倍。
爆炸视图与剖面:写明轴线,写明部件
爆炸视图是语料里浏览量最高的版式——中位数 130——下面两条提示词,一条是要求爆炸视图最短的方式,一条是最完整的方式之一。

二十四个词。它能当模板,是因为方括号在干活:换掉物体,其余部分——爆炸视图、白背景、内部部件、影棚光——固定不动。
产品设计,[带有材质亮点的物体或交通工具],爆炸视图分解图,白色背景,三维立体,高度精细的内部组件,影棚灯光,产品摄影,最佳品质

同一个想法,但构图已经定好。「沿一条中轴严格竖直排列」这句话让爆炸视图读起来像工程图而不是一堆碎片;「占画面 70%」和「略带俯视」拿掉了模型本来会做坏的两个决定。
一张斯嘉丽滴漏式咖啡机的逼真高级爆炸视图可视化图。咖啡机主体为黑色塑料配金属装饰,完全拆解,所有组件悬浮空中,沿中轴线严格垂直排列。逼真3D渲染,高端家电广告摄影级(Octane/Cinema 4D风格),PBR材质,塑料、玻璃与金属纹理细节极高。正面视角略向下倾斜。垂直画幅9:16。物体约占画面70%。氛围传达高端品质、洁净感、工程精度以及"看见咖啡如何运作"的理念。
两者的差别不在长度。短的那条把排列交给了模型;长的那条固定了轴线、相机倾角和物体在画面中的占比。当爆炸视图回来是一地零件时,几乎总是因为没人写明轴线。
剖面遵循同样的规则。成功的横截面提示词会指定切面(sliced cleanly down the centre、cut face facing the camera straight-on)和切开后露出什么(4 stacked floors、every internal layer)。语料里有一条要求切口边缘有真实的碎屑、断面里露出钢筋——这个细节让博物馆式的剖面读起来是实心的,而不是空壳。
流程与时间线:把数字说出来
38.5% 的信息图提示词写出了明确数量——exactly 6 structures、8 labels、9 distinct layers——20.5% 更进一步给条目编号(1. 数据收集、Step 1)。具体到流程和时间线提示词,42.9% 写下了数量;其余写 several stages 或 the key steps,拿回来的是三到九个不等。模型不擅长从形容词里数数。

「精确生成 6 个不同的建筑」,然后是这六个,逐一命名并用箭头排序。提示词还固定了它们之间的分隔物(地面的裂缝或光带)和每个时代允许使用的材料——于是数量、顺序和阶段之间的视觉边界,在模型开始之前都已经定了。
生成一幅超写实3D「时间线立体模型」,可视化图书馆的演化史。生成恰好6个不同结构。将人类历史(公元前5000年至公元2100年)均分为6个等距里程碑:古代→古典→哥特→工业→现代主义→未来。对每一个时代,为图书馆找出最具标志性的建筑风格。平台:一条连续延伸的对角线博物馆展台(大理石或混凝土)向远方展开。地面上的细微"裂缝"或光带划分各个时代。仅用该时期可获得的材料建造建筑:古代(泥、茅草、粗石)、古典/中世纪(大理石、木梁、彩色玻璃)、工业(红砖、铁、煤烟)、现代(混凝土、钢、平板玻璃)、未来(生物塑料、气凝胶、全息影像、绿植)。在每座建筑前放置由该时代主导材料制成的实体3D日期标签。相机:等距视角或高角度对角线。比例:1:100建筑模型风格。氛围:光线在画面中演变(左侧日出→正午→日落→右侧霓虹夜晚)。超宽画幅21:9,建筑渲染,博物馆级灯光。
流程提示词的第二个习惯:说明阅读方向。 语料里有一条食谱提示词要求 Z-shaped layout flow (top-left → top-right → bottom-left),这句话对可读性的贡献超过任何风格形容词,因为它告诉了模型箭头往哪边走。多格图指南讲了漫画和分镜里的同一个问题,那里格子的顺序就是全部意义。
对于前后对比,语料里浏览量最高的模式是一个抬高的底座一分为二——同一相机、同一比例、细节对照——而不是并排的两张图。

分割式立体模型模板:一个底座、两半、用微缩人物交代比例、标题和「Before & After」放在固定位置。最后一句——文字必须与背景形成对比——是对深色背景信息图最常见失败的修正。
创建一个清晰、45°俯视角等距微缩3D分割立体模型,展示[主题]在[转变]前后的对比。使用柔和精致纹理、真实PBR材质,两侧保持均衡光照。设计一个整体抬高的底座,分为两个环境,细节形成鲜明对比。加入微小风格化人物以强调尺度与变化(无面部细节)。使用干净纯色[背景颜色]背景。在顶部中央显示[主题名称]的大号粗体文字,其下方显示中等字体的"前后对比",再下方放置一个极简转变图标。所有文字必须自动匹配背景对比度(白色或黑色)。
文字:标题写全,标签加引号
这是信息图提示词与其他所有品类分歧最大的地方,也是模型分歧最宽的地方。
| 文字指令 | 占信息图提示词比例 | GPT Image | Nano Banana Pro |
|---|---|---|---|
| 标题在提示词里写全 | 55.1% | 70.9% | 30.3% |
| 层级用词(标题、副标题、图注、页脚) | 45.4% | 63.8% | 16.7% |
[TOPIC]、[OBJECT] 之类的占位符 | 34.1% | 38.6% | 31.8% |
| 指定字体 | 24.4% | 24.4% | 24.2% |
| 色板或十六进制色值 | 23.4% | 29.9% | 12.1% |
| 步骤或标签编号 | 20.5% | 25.2% | 13.6% |
要求可读(readable、no typos、exact text) | 20.0% | 26.8% | 10.6% |
| 指定输出语言 | 11.7% | 15.0% | 7.6% |
no text | 2.4% | 2.4% | 3.0% |
超过一半的信息图提示词把标题完整写出来,通常加引号——而在整体语料里,大多数提示词从不提文字。在 GPT Image 上是十条里有七条。要求可读文字的需求也集中在那里:26.8% 的 GPT Image 信息图提示词写了某种版本的 readable 或 no spelling errors,Nano Banana Pro 是 10.6%。人们已经学会了该盯着哪条路由。
语料里最有效的文字习惯是给标签加引号。不是 label the ingredients,而是 "200g spaghetti", "150g mushrooms", "3 garlic cloves"。加了引号的字符串是固定目标;对标签的描述是请模型发明一个,而错字就住在被发明的标签里。

五十三个词,其中七个是带分量的引号标签。所有模型可能拼错的东西都替它拼好了,流程步骤用图标而非文字——于是没有什么可以出错。
奶油大蒜蘑菇意面分步食谱信息图制作要求 呈现视角:俯视角度 设计风格:简约风格,白色背景 食材配图及标注:需包含“200克意大利面”“150克蘑菇”“3瓣大蒜”“200毫升淡奶油”“1汤匙橄榄油”“帕玛森奶酪”“欧芹”的图片,并分别标注对应文字 制作步骤展示:用虚线标注制作流程,搭配图标(煮锅、煎锅、搅拌)说明各步骤 成品呈现:在底部展示最终装盘的意面图片
哪条路由渲染这些字符串最可靠是一个受控问题,答案在哪个 AI 生图模型渲染文字最好——同样 12 条排版提示词交给每个模型,全部输出公开。如果你的标签是中文或日文,语料里 11.7% 明确写了输出语言,而这样做的提示词拿到一致文字的可能性高得多。

语言作为顶层键声明(「繁体中文」),标题加引号,3×3 网格并写明数量 9,每张卡一个标题加一句描述。GPT Image,323 词;JSON 的存在是为了让九张卡片不漂移。
{"type":"花草茶品种信息图海报","language":"简体中文","style":"干净高级的编辑类美食摄影拼贴,明亮的高调照明,柔和的自然阴影,白色背景,优雅的健康美学","subject":"一个 3x3 的网格,展示了九种无咖啡因花草茶,茶品盛放在透明玻璃杯中,杯旁散落着相应的植物花草","text":{"headline":"无咖啡因花草茶品种大全"},"layout":{"canvas":"竖版海报","background":"暖米白色纸张色调","grid":{"rows":3,"columns":3,"count":9,"cardStyle":"圆角矩形照片卡片,间距紧凑","imagePosition":"上方为图片,下方为标题和副标题"},"sections":[{"title":"洋甘菊茶","position":"第 1 行第 1 列","count":1,"labels":["花香柔和,口感温润舒缓"],"image":"透明玻璃杯中盛放着淡金色的洋甘菊茶,漂浮着白色和黄色的洋甘菊,白色桌面上散落着许多干洋甘菊花朵"},{"title":"薄荷茶","position":"第 1 行第 2 列","count":1,"labels":["清凉醒鼻,入口清新甘爽"],"image":"透明玻璃杯中盛放着浅绿色的薄荷茶,杯中插有新鲜薄荷枝,白色背景上摆放着额外的薄荷叶"},{"title":"洛神花茶","position":"第 1 行第 3 列","count":1,"labels":["酸甜明亮,果香浓郁迷人"],"image":"透明玻璃杯中盛放着鲜艳的红宝石色洛神花茶,周围摆放着干洛神花萼,后方放置或正在倾倒一个玻璃壶"},{"title":"玫瑰花茶","position":"第 2 行第 1 列","count":1,"labels":["花韵优雅,香气细腻柔美"],"image":"透明玻璃杯中盛放着柔粉色的玫瑰花茶,杯子周围散落着干玫瑰花蕾和粉色花瓣"},{"title":"菊花茶","position":"第 2 行第 2 列","count":1,"labels":["清香淡雅,茶汤甘润顺口"],"image":"透明玻璃杯中盛放着淡黄色的菊花茶,杯底周围摆放着完整的干黄菊花"},{"title":"薰衣草茶","position":"第 2 行第 3 列","count":1,"labels":["草本芬芳,尾韵柔和安定"],"image":"透明玻璃杯中盛放着半透明的紫色薰衣草茶,配有薰衣草枝,背景中有一个虚化的薰衣草罐子"},{"title":"桂花茶","position":"第 3 行第 1 列","count":1,"labels":["蜜香清甜,香气温暖悠长"],"image":"透明玻璃杯中盛放着淡金色的桂花茶,漂浮着细小的黄色桂花,周围散落着更多桂花"},{"title":"柠檬草茶","position":"第 3 行第 2 列","count":1,"labels":["柑橘清香,风味爽朗轻盈"],"image":"透明玻璃杯中盛放着浅绿色的柠檬草茶,杯旁放有切好的柠檬草茎,杯中浸泡着细长的叶片"},{"title":"蝶豆花茶","position":"第 3 行第 3 列","count":1,"labels":["色泽梦幻,口感清淡柔顺"],"image":"透明玻璃杯中盛放着鲜艳的蓝宝石色蝶豆花茶,放在茶托上,杯子周围装饰着蓝色花瓣和花朵"}]},"typography":{"headline":"顶部居中的大号深棕色衬线中文字体","cardTitles":"每张图片下方居中的加粗深棕色衬线中文字体","captions":"每个标题下方居中的较小灰色中文字体"},"colorPalette":{"dominant":["奶油白","深棕色","柔灰色"],"accentTeaColors":["淡金色","清新绿","红宝石色","柔粉色","薰衣草紫","桂花金","柠檬草绿","蝶豆花蓝"]},"constraints":["所有 9 种饮品均盛放在透明玻璃杯中","写实美食摄影,非插画","统一的白色摄影棚桌面","极简奢华布局","仅限简体中文","平衡的间距和整洁的页边距"]}风格、背景与画幅
信息图提示词几乎均分为两种视觉语言:37.6% 要求照片级或 3D 渲染,30.7% 要求扁平、矢量或手绘插画。 两者很少在一条提示词里混用,而语料里浏览量最高的是照片级那一类——真实材质的渲染咖啡机、带 PBR 贴图的立体模型——而不是「信息图」这个词通常让人想到的扁平图表。
背景被说明的频率高于产品提示词:26.8% 要求白色、纸张或羊皮纸,7.3% 要求蓝图,5.4% 要求深色底。上面两条立体模型模板都以一句强制文字与所填背景色形成对比的话结尾,这不是巧合——中间调底座上不可读的标题是这个品类最常见的失败。
画幅分布是把信息图与图库里其他所有品类区分开的那一项:
| 画幅 | 信息图提示词 | 产品提示词(对照) |
|---|---|---|
| 1:1 | 20.5% | 18.6% |
| 2:3 | 18.5% | 12.8% |
| 16:9 | 16.6% | 8.6% |
| 9:16 | 13.2% | 17.9% |
| 3:4 | 9.8% | 23.7% |
| 3:2 | 6.8% | 2.7% |
| 4:3 | 4.4% | 1.4% |
横版比例(16:9、3:2、4:3)占信息图提示词的 27.8%——是它们在产品摄影提示词里占比的两倍以上。时间线和爆炸视图要宽度;食谱海报和步骤指南要高度。在写版式之前先决定这一点,因为画幅决定了八个步骤排成一行还是两行。

一张从左读到右的 16:9 展示板:二维平面图,然后是立面和剖面,然后是照片级渲染。提示词写明了顺序和它们之间色调的过渡——这正是横版信息图需要、竖版不需要的东西。
一位专业的建筑插画师为[风格]住宅制作的展示板,该住宅以[关键建筑元素]为特色。 画布从左到右依次为:左侧为黑白二维图纸(场地平面图、楼层平面图),中间为立面图和剖面图,右侧为[一天中的时间/光照条件]下的照片级三维渲染图。 统一的美学风格融合了[线条风格]和[纹理/材质]。[技术绘图色调]过渡到[渲染调色板]。标题栏显示“[项目名称]”。
长度与结构:长一倍,而 JSON 在这里不占优
信息图提示词长度中位数是 186 词——全站 93 的两倍,比产品提示词的 123 又长一半。四分之一超过 291 词,十分之一超过 437。这不是啰嗦;一条要命名六个阶段、八个标签和一个标题的提示词,就是有更多要说。
33.7% 的信息图提示词用 JSON 书写,是全站 11.1% 的三倍。而在这里语料自相矛盾了:在我们八月测量的全部 9,599 条提示词里,JSON 提示词的浏览量中位数是散文的 11 倍。在信息图里,散文领先——中位数 57 对 JSON 的 17。
解释在于模型构成,不在格式。GPT Image 的信息图提示词有 52.0% 是 JSON;Nano Banana Pro 的只有 4.5%。这个品类里 GPT Image 条目的浏览量中位数是 23,Nano Banana Pro 是 290,所以在这里比较 JSON 与散文,比的主要是一个模型的信息流与另一个的。控制模型之后,效应在两个方向上都消失了。诚实的读法:对信息图而言,JSON 是把九张卡或八个区块稳住的工具,不是互动量的杠杆。
大家把信息图交给哪个模型
| GPT Image | Nano Banana Pro | Midjourney | |
|---|---|---|---|
| 信息图提示词条数 | 127(62.0%) | 66(32.2%) | 11(5.4%) |
| 占该模型自身语料比例 | 3.1% | 1.9% | 0.3% |
| 词数中位数 | 233 | 117 | 60 |
| 用 JSON 书写 | 52.0% | 4.5% | 0% |
| 标题写全 | 70.9% | 30.3% | 18.2% |
| 网格或分格版式 | 58.3% | 18.2% | 18.2% |
| 立体模型或等距场景 | 22.0% | 22.7% | 9.1% |
| 剖面或横截面 | 10.2% | 19.7% | 18.2% |
| 爆炸视图 | 3.9% | 15.2% | 9.1% |
| 食谱或食物 | 10.2% | 28.8% | 18.2% |
人们把文字密集、基于网格的信息图——带标题、八个格子和页脚的海报——交给 GPT Image,而且写得长、写得结构化。把剖切类的交给 Nano Banana Pro:爆炸视图、剖面、当作摄影来布置的食谱。立体模型两边平分。Midjourney 几乎不出现;它的语料只有 0.3% 是信息图,存在的那些提示词也很短。
这个分工与两条路由的长项一致。GPT Image 能在网格里稳住大量排版;Nano Banana Pro 能稳住一个渲染物体和它的材质。如果作品主要是框里的文字,交给前者。如果主要是一个带标注的物体,交给后者,并且给标签加引号。
一份可以直接复制的简报
能产出干净信息图的提示词,在描述任何风格之前先决定五件事:版式、数量、阅读方向、确切文字、什么必须保持可读。这份模板按这个顺序排列。
类型:[OBJECT 或 TOPIC] 的 [爆炸视图 / 剖面 / 流程图 / 时间线 / 食谱海报 / 规格表]
版式:[单一竖直中轴 / 抬高底座上的 45° 等距立体模型 / 2×4 网格 / 从左到右的展示板];阅读顺序 [从上到下 / Z 形,左上到右下]
数量:精确 [6] 个 [阶段 / 部件 / 卡片],编号 [1–6],顺序如下:[A → B → C → D → E → F]
标注:[8] 个标签,左侧 [4] 个、右侧 [4] 个,细 [黑色 / 金色] 引线指向所标注的部件
文字(加引号):标题 "[确切标题]" 置顶居中;副标题 "[确切副标题]";标签 "[标签 1]"、"[标签 2]"……;语言 [English / 繁体中文];所有文字必须与背景形成对比
风格:[照片级 3D 渲染,PBR 材质,影棚光 / 扁平矢量,双色,手绘线条];背景 [纯白 / 暖色纸张 / 哑光黑]
画幅:[时间线或展示板用 16:9 / 海报用 3:4 / 单个物体用 1:1]
禁止:[在引号字符串之外添加文字 / 发明额外部件 / 把标签压在物体上]
删掉不需要的行,但保留「数量」和「文字(加引号)」——语料里失败的信息图,错就错在这两处。如果主题是一件你有照片的真实产品,参考图编辑提示词实测里的参考图工作流适用:在版式之前,先写什么不能变。
关于咖啡是怎么做出来的精细信息图,专业,干净的设计,易读
流程图,精确 5 个阶段从左到右:采摘、干燥、烘焙、研磨、冲煮;每个阶段是抬高白色基座上的一个照片级 3D 物体;黑色无衬线体编号 1–5;标题 'FROM CHERRY TO CUP' 加引号置顶居中;16:9;除标题和五个阶段名外不要任何文字
常见问题
AI 生图模型能做信息图吗?
能,但有限度。在 205 条提示词的语料里,可靠有效的版式是爆炸视图、剖面、立体模型、编号流程图和食谱海报——信息主要是空间性的、文字只是一个标题加少量标签的那类图。带很多数字的密集数据图表依然不可靠,因为每一个数字都是一次出错字的机会。
怎样让 AI 信息图的步骤数正确?
先写数字,再列步骤。Exactly 6 stages: A → B → C → D → E → F 产出六个;several stages 产出三到九个不等。语料里 38.5% 的信息图提示词写明了数量,20.5% 给条目编了号——其余把数量留给了模型。
怎样避免 AI 信息图里的拼写错误?
给每个要渲染的字符串加引号——标题、副标题、每个标签——再加一句 no text beyond the quoted strings。描述标签的提示词(label the ingredients)是请模型发明文字;引用标签的提示词("200g spaghetti")给了它一个固定目标。20% 的信息图提示词明确要求可读文字,在 GPT Image 上升到 26.8%。
哪个 AI 模型最适合做信息图?
语料按任务分工。GPT Image 收到 62% 的信息图提示词,拿到的是文字密集、基于网格的那些——其中 70.9% 写全了标题,58.3% 要求网格。Nano Banana Pro 拿到剖切类的:爆炸视图(占其信息图提示词的 15.2%)、剖面、当作摄影来布置的食谱。框里的文字交给前者,带标注的物体交给后者。
信息图提示词该用 JSON 写吗?
当你需要稳住许多平行元素时用它——网格里的九张卡、各带标签的八个区块。33.7% 的信息图提示词是 JSON,是全站比例的三倍;GPT Image 的信息图提示词有 52% 是。但控制模型之后,JSON 在这个品类里并不提升互动量;它是结构工具,不是质量杠杆。
















