技巧9 分钟阅读
9,599 条真实 AI 生图提示词里到底写了什么
这是计数不是观点:对 9,599 条已发布提示词测量长度、结构与技术词汇——包括同等长度下结构化提示词为何胜过散文。

我们测了什么
大多数提示词建议,是把一个人的习惯上升成了规律。这一篇是计数。
我们取了 LocalBanana 图库里的 9,599 条 AI 生图提示词——所有已发布、长度超过 20 字符的条目——测量它们实际包含什么:多长、怎么组织、用了哪些技术词汇。每条提示词都存着运行它的模型和产出的图片。
9,599
条提示词纳入分析
全部已发布图库条目,2026 年 8 月
83
词,提示词长度中位数
均值 128——分布严重右偏
13%
用结构化 JSON 而非散文书写
而它们的表现完全不同
方法论,以及这些数字说不了什么
词频是对语料的精确计数。互动数据用的是站内浏览量,它同时受条目发布时长和信息流曝光位置影响——所以所有互动对比都是相关性,不是因果证明。凡是存在明显混淆因素的对比,我们都做了控制并明确说明。
AI 生图提示词该写多长?
提示词长度中位数是 83 词,均值 128——说明分布有一条很长的右尾,有相当一批人写得远超中位数。
| 提示词长度 | 语料占比 | 浏览量中位数 |
|---|---|---|
| 30 词以下 | 20%(1,966) | 4 |
| 30–79 词 | 28%(2,670) | 5 |
| 80–149 词 | 22%(2,129) | 19 |
| 150 词以上 | 30%(2,834) | 39 |
从最短档到最长档,互动中位数上升约 10 倍。而且不是渐进的——跳变发生在 79 到 80 词之间,中位浏览从 5 跳到 19。
这个阈值是实用结论。80 词以下的提示词通常只描述了主体;超过之后才有余地同时指定光线、镜头、构图和情绪——模型也就不用猜了。
长度不是机制
写 200 词废话没有用。长提示词表现更好,是因为长提示词承载了更多规格,不是更多字。下一节是同一效应更强的版本。
结构比长度更重要吗?
是——而且这是整份语料里最出人意料的结果。
13% 的提示词是结构化 JSON,而非散文:一个带 scene、subject、lighting、camera、style 等键的对象。其余是句子。
| 书写方式 | 数量 | 浏览量中位数 |
|---|---|---|
| 散文 | 8,350 | 9 |
| 结构化 JSON | 1,249 | 98 |
中位互动差 11 倍。JSON 提示词平均也更长(278 词对 105 词),所以最直接的质疑是:这是不是只是在重新测量长度?
我们做了控制。在每一个长度区间内,结构化仍然胜出:
| 长度区间 | 散文中位浏览 | JSON 中位浏览 |
|---|---|---|
| 80–149 词 | 17 | 141 |
| 150–299 词 | 32 | 67 |
| 300 词以上 | 33 | 98 |
同样长度、不同结构,结果稳定不同。效应在 80–149 词区间最强——把一条中等长度的提示词结构化,对应约 8 倍于同等篇幅散文的中位互动。
它为什么可能有效:JSON 对象逼你给每个槽位命名。你没法把 lighting 留空而不被自己发现;散文却允许你写出一句漂亮的、从头到尾没提光从哪来的话。
{
"subject": "young woman, mid-20s, shoulder-length dark hair",
"wardrobe": "oversized cream knit sweater",
"setting": "sunlit café window seat, mid-morning",
"lighting": "soft window light from camera left, warm bounce",
"camera": "85mm, f/1.8, eye level, shallow depth of field",
"mood": "quiet, unposed, candid",
"style": "editorial photography, fine film grain"
}

CCD闪光灯酒店慵懒脱鞋瞬间
Nano Banana Pro提示词▾
基于用户肖像,一位年轻女性躺在白色沙发上,从正上方俯拍视角,慵懒放松的姿势,仰望镜头。凌乱蓬松的头发散落在沙发垫上,表情放松略带倦意,深夜私密氛围。仰卧在沙发上,一只手伸向脚跟正在脱高跟鞋,手指勾着鞋后跟即将滑落,另一只手放在头旁或头发里,双腿微曲,捕捉脱鞋的瞬间。穿着黑色西装裙、黑色透明丝袜,高跟鞋正在被脱下握在手中。构图为俯视鸟瞰全身照,28-35mm广角卡片机,直接从正上方拍摄。主体对角线填满画面,沙发和地板边缘可见,随意快照式构图。直射机顶闪光灯,刺眼且不讲究,硬闪产生皮肤和面料上的强烈高光,沙发上有明显投影,眼中有闪光反射,额头和颧骨过曝热点。CCD卡片机闪光灯风格,2000年代初数码傻瓜相机,直闪高ISO噪点,暖色白炽灯环境光混合冷色闪光,色彩略浑浊。酒店客房内部,夜间,白色沙发,大理石地板隐约可见,窗外城市灯光。深夜私密瞬间,派对后回酒店的氛围,卡片机闪光灯抓拍,原始未修饰。
大家实际在用哪些光线关键词?
主体之后,光线是人们最常动用的词汇。下表是含该词的提示词占全部 9,599 条的比例:
| 光线词 | 提示词占比 |
|---|---|
| studio lighting | 6.5% |
| cinematic lighting | 4.8% |
| rim light | 3.9% |
| natural light | 3.8% |
| flash | 3.5% |
| golden hour | 2.7% |
| soft light | 2.6% |
| backlight | 1.8% |
| warm light | 1.5% |
| overcast | 1.5% |
两点值得注意。rim light 占 3.9%,远比它的"进阶技巧"名声更普及——它已经悄悄成了标准词汇。而 flash 占 3.5%,反映了直闪审美的彻底流行:人们是故意在要一台廉价相机的观感。
明显稀缺的:top light(0.05%)、candlelight(0.2%)、blue hour(0.2%)。不是因为它们没用,而是因为很少有人想到要。
相机参数里哪些出现最多?
| 相机 / 构图词 | 提示词占比 |
|---|---|
| depth of field(景深) | 14.5% |
| shallow depth of field | 11.1% |
| close-up | 9.3% |
| bokeh | 5.4% |
| symmetry / symmetrical | 5.1% |
| 85mm | 4.9% |
| 35mm | 3.5% |
| full body | 3.3% |
| negative space | 2.7% |
| low angle | 2.5% |
| 50mm | 2.4% |
| f/1.8 | 2.0% |
每七条提示词就有一条提到景深——它是整份语料里最常见的技术指令。焦段里 85mm 以 4.9% 领先,约为 35mm 的 1.4 倍、50mm 的 2 倍,与图库偏人像的结构一致。
光圈比焦段稀缺得多:f/1.8 占 2.0%、f/2.8 占 1.3%。大多数人报了镜头却不报光圈——这挺反常的,因为正是光圈产生了他们当中 11% 点名要的浅景深。
不同模型分别被要求做什么?
同一份语料,按运行模型拆开:
| Nano Banana | GPT Image | Midjourney | |
|---|---|---|---|
| 语料中的提示词数 | 3,305 | 2,043 | 4,305 |
| 要求文字/排版 | 21.8% | 51.7% | 7.9% |
| 带摄影参数 | 45.5% | 28.0% | 9.6% |
| 要求插画/动漫 | 19.4% | 36.2% | 17.0% |
人们把摄影类交给 Nano Banana、文字与版面交给 GPT Image,而给 Midjourney 写的是全场技术含量最低的提示词。这个分野我们在《Nano Banana vs DALL·E》里做了拆解。
下一条提示词可以改的五件事
- 写过 80 词。 那是互动中位数发生跳变的位置,也大致是一条提示词能同时装下主体、光线、镜头和情绪的长度。
- 把它结构化。 哪怕只是一份带标签的清单——主体、场景、光线、相机、情绪、风格——也能复现 JSON 效应的大部分。重点是让你没法把某个槽位留空。
- 给光线命名。 6% 的语料写了
studio lighting,其余大部分对光只字未提。只要你说得具体一点,就已经领先中位数。 - 报光圈,不要只报镜头。 11% 的人要浅景深,只有 2% 写了
f/1.8。把光圈说出来,别再靠祈祷。 - 偷一个稀缺词。
blue hour、candlelight、side lighting、top light各自都低于语料的 0.5%。它们效果没问题,只是很少被人要。
✕ 只堆形容词
beautiful cinematic portrait, professional, highly detailed✓ 主体、镜头、光线、背景都有约束
waist-up portrait of a woman in a charcoal coat, 85mm at f/1.8, overcast window light from camera left, pale concrete wall 4m behind, natural skin texture常见问题
AI 生图提示词该写多长?
在 9,599 条语料中,长度中位数是 83 词,且互动中位数在 80 词以上出现明显跳变——从 5 升到 19。大多数场景建议写 80–150 词:足以指定主体、光线、相机和情绪,又不至于灌水。
提示词越长出图越好吗?
在我们的数据里,长度与互动正相关,但机制不是长度而是规格密度。一条 200 词的形容词堆砌,赢不了一条 90 词但点明了光线、镜头和构图的提示词。
提示词应该用 JSON 写吗?
在同等长度下,结构化提示词的中位互动显著高于散文——80–149 词区间是 141 对 17。严格的 JSON 语法不是重点,带标签的槽位才是,因为它让"某项没填"变得可见。
AI 提示词里最常见的技术词是什么?
景深(depth of field),出现在 14.5% 的提示词里,其次是 close-up(9.3%)和 bokeh(5.4%)。光线词里 studio lighting 以 6.5% 居首。
AI 提示词里哪个焦段用得最多?
85mm,占 4.9%——领先于 35mm(3.5%)和 50mm(2.4%)。这个排序反映的是一个偏人像的语料;若换成偏风光的图库,顺序很可能反转。










