技巧9 分钟阅读

9,599 条真实 AI 生图提示词里到底写了什么

这是计数不是观点:对 9,599 条已发布提示词测量长度、结构与技术词汇——包括同等长度下结构化提示词为何胜过散文。

9,599 条真实 AI 生图提示词里到底写了什么

我们测了什么

大多数提示词建议,是把一个人的习惯上升成了规律。这一篇是计数。

我们取了 LocalBanana 图库里的 9,599 条 AI 生图提示词——所有已发布、长度超过 20 字符的条目——测量它们实际包含什么:多长、怎么组织、用了哪些技术词汇。每条提示词都存着运行它的模型和产出的图片。

9,599

条提示词纳入分析

全部已发布图库条目,2026 年 8 月

83

词,提示词长度中位数

均值 128——分布严重右偏

13%

用结构化 JSON 而非散文书写

而它们的表现完全不同

方法论,以及这些数字说不了什么

词频是对语料的精确计数。互动数据用的是站内浏览量,它同时受条目发布时长和信息流曝光位置影响——所以所有互动对比都是相关性,不是因果证明。凡是存在明显混淆因素的对比,我们都做了控制并明确说明。

AI 生图提示词该写多长?

提示词长度中位数是 83 词,均值 128——说明分布有一条很长的右尾,有相当一批人写得远超中位数。

提示词长度语料占比浏览量中位数
30 词以下20%(1,966)4
30–79 词28%(2,670)5
80–149 词22%(2,129)19
150 词以上30%(2,834)39

从最短档到最长档,互动中位数上升约 10 倍。而且不是渐进的——跳变发生在 79 到 80 词之间,中位浏览从 5 跳到 19。

这个阈值是实用结论。80 词以下的提示词通常只描述了主体;超过之后才有余地同时指定光线、镜头、构图和情绪——模型也就不用猜了。

长度不是机制

写 200 词废话没有用。长提示词表现更好,是因为长提示词承载了更多规格,不是更多字。下一节是同一效应更强的版本。

结构比长度更重要吗?

是——而且这是整份语料里最出人意料的结果。

13% 的提示词是结构化 JSON,而非散文:一个带 scenesubjectlightingcamerastyle 等键的对象。其余是句子。

书写方式数量浏览量中位数
散文8,3509
结构化 JSON1,24998

中位互动差 11 倍。JSON 提示词平均也更长(278 词对 105 词),所以最直接的质疑是:这是不是只是在重新测量长度?

我们做了控制。在每一个长度区间内,结构化仍然胜出

长度区间散文中位浏览JSON 中位浏览
80–149 词17141
150–299 词3267
300 词以上3398

同样长度、不同结构,结果稳定不同。效应在 80–149 词区间最强——把一条中等长度的提示词结构化,对应约 8 倍于同等篇幅散文的中位互动。

它为什么可能有效:JSON 对象逼你给每个槽位命名。你没法把 lighting 留空而不被自己发现;散文却允许你写出一句漂亮的、从头到尾没提光从哪来的话。

{
  "subject": "young woman, mid-20s, shoulder-length dark hair",
  "wardrobe": "oversized cream knit sweater",
  "setting": "sunlit café window seat, mid-morning",
  "lighting": "soft window light from camera left, warm bounce",
  "camera": "85mm, f/1.8, eye level, shallow depth of field",
  "mood": "quiet, unposed, candid",
  "style": "editorial photography, fine film grain"
}
CCD闪光灯酒店慵懒脱鞋瞬间

CCD闪光灯酒店慵懒脱鞋瞬间

Nano Banana Pro
提示词
基于用户肖像,一位年轻女性躺在白色沙发上,从正上方俯拍视角,慵懒放松的姿势,仰望镜头。凌乱蓬松的头发散落在沙发垫上,表情放松略带倦意,深夜私密氛围。仰卧在沙发上,一只手伸向脚跟正在脱高跟鞋,手指勾着鞋后跟即将滑落,另一只手放在头旁或头发里,双腿微曲,捕捉脱鞋的瞬间。穿着黑色西装裙、黑色透明丝袜,高跟鞋正在被脱下握在手中。构图为俯视鸟瞰全身照,28-35mm广角卡片机,直接从正上方拍摄。主体对角线填满画面,沙发和地板边缘可见,随意快照式构图。直射机顶闪光灯,刺眼且不讲究,硬闪产生皮肤和面料上的强烈高光,沙发上有明显投影,眼中有闪光反射,额头和颧骨过曝热点。CCD卡片机闪光灯风格,2000年代初数码傻瓜相机,直闪高ISO噪点,暖色白炽灯环境光混合冷色闪光,色彩略浑浊。酒店客房内部,夜间,白色沙发,大理石地板隐约可见,窗外城市灯光。深夜私密瞬间,派对后回酒店的氛围,卡片机闪光灯抓拍,原始未修饰。
真实的结构化提示词——每个槽位都填了,没有留给模型自由发挥的余地。在 LocalBanana 打开

大家实际在用哪些光线关键词?

主体之后,光线是人们最常动用的词汇。下表是含该词的提示词占全部 9,599 条的比例:

光线词提示词占比
studio lighting6.5%
cinematic lighting4.8%
rim light3.9%
natural light3.8%
flash3.5%
golden hour2.7%
soft light2.6%
backlight1.8%
warm light1.5%
overcast1.5%

两点值得注意。rim light 占 3.9%,远比它的"进阶技巧"名声更普及——它已经悄悄成了标准词汇。而 flash 占 3.5%,反映了直闪审美的彻底流行:人们是故意在要一台廉价相机的观感。

明显稀缺的:top light(0.05%)、candlelight(0.2%)、blue hour(0.2%)。不是因为它们没用,而是因为很少有人想到要。

相机参数里哪些出现最多?

相机 / 构图词提示词占比
depth of field(景深)14.5%
shallow depth of field11.1%
close-up9.3%
bokeh5.4%
symmetry / symmetrical5.1%
85mm4.9%
35mm3.5%
full body3.3%
negative space2.7%
low angle2.5%
50mm2.4%
f/1.82.0%

每七条提示词就有一条提到景深——它是整份语料里最常见的技术指令。焦段里 85mm 以 4.9% 领先,约为 35mm 的 1.4 倍、50mm 的 2 倍,与图库偏人像的结构一致。

光圈比焦段稀缺得多:f/1.8 占 2.0%、f/2.8 占 1.3%。大多数人报了镜头却不报光圈——这挺反常的,因为正是光圈产生了他们当中 11% 点名要的浅景深

不同模型分别被要求做什么?

同一份语料,按运行模型拆开:

Nano BananaGPT ImageMidjourney
语料中的提示词数3,3052,0434,305
要求文字/排版21.8%51.7%7.9%
带摄影参数45.5%28.0%9.6%
要求插画/动漫19.4%36.2%17.0%

人们把摄影类交给 Nano Banana、文字与版面交给 GPT Image,而给 Midjourney 写的是全场技术含量最低的提示词。这个分野我们在《Nano Banana vs DALL·E》里做了拆解。

下一条提示词可以改的五件事

  1. 写过 80 词。 那是互动中位数发生跳变的位置,也大致是一条提示词能同时装下主体、光线、镜头和情绪的长度。
  2. 把它结构化。 哪怕只是一份带标签的清单——主体、场景、光线、相机、情绪、风格——也能复现 JSON 效应的大部分。重点是让你没法把某个槽位留空
  3. 给光线命名。 6% 的语料写了 studio lighting,其余大部分对光只字未提。只要你说得具体一点,就已经领先中位数。
  4. 报光圈,不要只报镜头。 11% 的人要浅景深,只有 2% 写了 f/1.8。把光圈说出来,别再靠祈祷。
  5. 偷一个稀缺词。 blue hourcandlelightside lightingtop light 各自都低于语料的 0.5%。它们效果没问题,只是很少被人要。

只堆形容词

beautiful cinematic portrait, professional, highly detailed

主体、镜头、光线、背景都有约束

waist-up portrait of a woman in a charcoal coat, 85mm at f/1.8, overcast window light from camera left, pale concrete wall 4m behind, natural skin texture

常见问题

AI 生图提示词该写多长?

在 9,599 条语料中,长度中位数是 83 词,且互动中位数在 80 词以上出现明显跳变——从 5 升到 19。大多数场景建议写 80–150 词:足以指定主体、光线、相机和情绪,又不至于灌水。

提示词越长出图越好吗?

在我们的数据里,长度与互动正相关,但机制不是长度而是规格密度。一条 200 词的形容词堆砌,赢不了一条 90 词但点明了光线、镜头和构图的提示词。

提示词应该用 JSON 写吗?

在同等长度下,结构化提示词的中位互动显著高于散文——80–149 词区间是 141 对 17。严格的 JSON 语法不是重点,带标签的槽位才是,因为它让"某项没填"变得可见。

AI 提示词里最常见的技术词是什么?

景深(depth of field),出现在 14.5% 的提示词里,其次是 close-up(9.3%)和 bokeh(5.4%)。光线词里 studio lighting 以 6.5% 居首。

AI 提示词里哪个焦段用得最多?

85mm,占 4.9%——领先于 35mm(3.5%)和 50mm(2.4%)。这个排序反映的是一个偏人像的语料;若换成偏风光的图库,顺序很可能反转。

LocalBanana Team

我们同时运行 Nano Banana、GPT Image 等模型,并把图库里的每条提示词公开发布。这些指南就写自那份语料。

更新于 @LocalBanana_io

相关文章