初学者常犯的 10 个提示词错误(以及如何修复)
避免这些常见陷阱,通过简单的修复立即改善你的 AI 图像生成结果。

本页目录
这十条是怎么挑出来的
大多数「新手错误」清单是某个人的习惯被写成了规则。这十条的挑法不一样:拿一条短提示词通常包含什么,去比对 LocalBanana 图库里 9,599 条已发布提示词——所有正文长于 20 字符的条目,每条都存着运行它的模型和产出的图片。
所以下面每一条错误都带一个数字:修正后的写法在语料里到底有多常见,以及修正版长什么样、可以直接复制。
20%
9,599 条里有 1,966 条——新手提示词最典型的形状
11.1%
但其中 77.6% 从没写过光圈
4 对 19
跳变发生在 80 词,不是渐进的
错误 1:提示词写完主体就停了
语料里五分之一不到 30 词。这些提示词几乎都是点了个主体就结束——光线、镜头、构图、服装、情绪全部交给模型的默认值,而所有人的默认值是同一套。
按长度看中位浏览量说的是同一件事:不到 30 词是 4,30–79 词是 5,然后 80–149 词跳到 19。这个台阶不是渐进的,它落在「一条提示词刚好能同时装下主体、光线、相机和情绪」的长度上。
咖啡馆里的女人,美丽,高质量
A woman in her late twenties sitting at a cafe window seat, mid-morning, oversized cream knit sweater, hands around a ceramic cup, looking out of frame to camera left. Soft window light from the left, warm bounce off the table. 85mm, f/1.8, eye level, shallow depth of field. Quiet, unposed, editorial.

一条散文提示词,但服装、墙面材质、姿态和光线都指定了——长度花在事实上,不是形容词上。
一位年轻女性站在简洁的室内环境中,身后是奶油色瓷砖墙壁。她穿着一件紧身巧克力棕色长袖罗纹亨利衫,顶部几颗纽扣随意解开,露出自然的锁骨线条。姿态放松挺立,双臂自然垂于身侧。中景取景,从大腿中部以上构图,平视相机角度。柔和漫射的室内灯光从头顶天花板照射,在身后瓷砖墙上投下轻柔的向下阴影。表情沉静从容,直视镜头,散发自信的自然美。高保真超写实,准确的皮肤纹理、面料罗纹细节和自然发质。休闲手机随拍肖像美学,仿佛在日常生活中随手捕捉。自然暖色调,巧克力棕、奶油色和柔和肤色。锐利对焦,精准质感还原,3:4竖幅比例。
错误 2:要虚化,却不给光圈
整份语料里最锐利的一个矛盾:11.1% 的提示词点名要浅景深,而其中 77.6% 从没写过 f/1.8 这样的光圈。 大家描述了效果,却扣下了产生这个效果的那个参数。
焦距的覆盖率好得多——85mm 出现在 4.9% 的提示词里,35mm 3.5%,50mm 2.4%。所以典型写法是「给镜头、不给光圈」,而光圈才是真正控制虚化的那一半。
人像,背景要虚化得好看,bokeh,专业
85mm, f/1.8, focus on the eyes, background falls off into soft bokeh, subject 2 metres from a brick wall 6 metres behind her
距离和数字一样重要。f/1.8 但人贴着墙,等于没有分离;同样的光圈、身后留六米,才是大家想要的那个样子。
错误 3:不写光线
studio lighting 是语料里最高频的光线词,占 6.5%。其余全部更低:cinematic lighting 4.8%、rim light 3.9%、natural light 3.8%。全部加起来,大多数提示词依然对光线只字未提。
这是最便宜的一次升级。写清方向、质感和光源,八个词就能让你超过中位数。
打光好看,戏剧性,电影感
Single hard key from camera right at 45 degrees, no fill, deep shadow down the left side of the face, cool practical light in the background

这条的光线指令给的是颜色和房间,不是情绪词——青蓝主光打在瓷砖墙上。
{
"scene_description": {
"location": "冷峻审讯室,青蓝色砖砌瓷砖墙面,电影《本能》(1992)的静止画面",
"vibe": "强烈诱惑力量,经典黑色电影张力,掌控全场的气场",
"lighting": "青蓝色环境房间光,左侧强烈方向性主光投射长阴影,轮廓光勾勒身形与双腿,高对比度,戏剧化新黑色电影氛围",
"camera_settings": "35mm变形镜头,f/2.0,浅景深,电影胶片颗粒,轻微镜头呼吸,超写实8K,《本能》色调(冷青蓝阴影,暖肤色高光)"
},
"primary_subjects": [
{
"character": "贴脸名人替身",
"role": "审讯对象 / 终极蛇蝎美人",
"action": "坐于黑色金属椅,右腿搭左腿交叉诱惑,右臂随意搭椅背,左手置大腿,上身微后仰,髋部前倾,锐利直视镜头,唇角自信半笑",
"details": "无袖白色高领迷你裙贴身勾勒曲线,裸露紧致美腿带光泽,白色尖头高跟鞋,长而亮泽深色卷发,烟熏猫眼妆,大红唇,右手腕金手镯"
}
],
"environment_details": {
"crowd": "无——孤独电影张力",
"architecture": "青蓝色砖砌瓷砖墙面,黑色金属椅,混凝土地面",
"fidelity": "超写实8K,冷光下逼真肌肤,织物细节,发丝光泽,精确还原《本能》凯瑟琳·特拉梅尔姿态、灯光与氛围"
}
}二十个光线词的完整频次表、以及每个词落到脸上是什么效果,在《光线关键词指南》。
错误 4:写成一大段散文,而不是带标签的槽位
语料的 13%(1,249 条)是用结构化 JSON 写的,不是散文。这批提示词的中位浏览量明显更高——整体 98 对 9——而且控制长度后仍然成立:在 80–149 词区间,结构化提示词中位浏览 141,同长度散文只有 17。再说一次:这是相关性,且长提示词在各方面都占便宜。但它的机制很容易相信。
带标签的槽位没法被无声跳过。 散文允许你写出一个漂亮的句子,而这个句子从头到尾没提光从哪来。
{
"subject": "man, early 30s, short dark hair, three-day stubble",
"wardrobe": "charcoal wool overcoat, grey crew neck underneath",
"setting": "empty underground car park, concrete pillars, wet floor",
"lighting": "overhead fluorescent strips, hard top light, green colour cast",
"camera": "35mm, f/2.8, low angle, full body",
"mood": "still, waiting, unglamorous",
"style": "documentary photography, fine grain"
}

真实的 JSON 提示词:主体、表情、姿态、相机各占一个 key。
{
"subject": {
"description": "一位拥有冷艳气质的亚洲时尚博主,高角度拍摄,画面极具视觉冲击力。",
"age": "20多岁",
"expression": {
"eyes": {
"look": "锐利的狐狸眼,目光直视镜头,穿透力极强",
"energy": "自信、微冷、带有诱惑感",
"details": "清晰眼线,强调卧蚕"
},
"mouth": {
"position": "嘴唇自然放松,带有若有若无的轻蔑微笑",
"energy": "高级时髦感"
},
"overall": "惊艳、高视觉冲击力的美感"
},
"face": {
"preserve_original": false,
"makeup": "高对比度妆容,冷白瓷肌,红调渐变唇色,清晰利落的下颌线,V型脸",
"style": "冷色调审美,K-pop 偶像视觉风格"
},
"hair": {
"color": "黑色",
"style": "顺直的长直发,齐刘海",
"effect": "光泽感强烈的高端时尚质感"
},
"body": {
"frame": "纤细、娇小、略显脆弱感的身形",
"pose": {
"position": "身体明显向前倾",
"overall": "强烈的透视压缩效果,重点突出头部与上半身"
},
"skin": {
"tone": "冷白肤色",
"lighting_effect": "面部提亮,柔和美颜光,无明显暗部阴影"
}
},
"clothing": {
"top": {
"type": "超细针织上衣",
"color": "冷灰色",
"details": "半高领,紧身剪裁,轻薄细腻的面料(非厚重材质)",
"effect": "完美勾勒身体曲线,面料平滑细腻"
},
"bottom": {
"type": "深色铅笔裙",
"details": "高腰设计,搭配细款奢华感腰带"
}
}
},
"photography": {
"camera_style": "高端社交媒体快照风格",
"angle": "高角度 POV",
"shot_type": "中近景特写",
"aspect_ratio": "9:16",
"texture": "画面清晰锐利,略带美颜滤镜",
"lighting": "阴天冷调自然光,柔和漫射光线"
},
"background": {
"setting": "欧洲经典建筑环境",
"atmosphere": "时尚感街角场景",
"blur": "背景虚化,突出主体"
},
"negative_prompt": [
"圆脸",
"普通路人脸",
"素颜",
"偏暖黄色肤色",
"粗针织",
"厚重毛衣",
"宽松服装",
"褶皱面料",
"无神眼睛",
"亲切但无聊的笑容",
"低分辨率",
"昏暗光线"
]
}
不需要严格的 JSON。一份普通的清单——主体:/场景:/光线:/相机:/情绪:——就能复现大部分效果,因为空着的那一行是看得见的。
错误 5:堆质量形容词,而不是堆规格
masterpiece、8k、ultra detailed、award winning、hyperrealistic——这些是上一代模型留下的习惯,它们占掉的正是你本可以用来写事实的字数。长提示词表现更好,是因为它装了更多规格,不是更多字。两百字的赞美,依然是一条什么都没说的提示词。
masterpiece, best quality, 8k, ultra detailed, award winning photography, stunning, breathtaking, hyperrealistic portrait of a woman
Portrait of a woman in her forties, visible skin texture and fine lines left intact, no retouching. Soft north-facing window light, white wall two metres behind. 85mm, f/2.8, chest-up framing.
正例更短,却多做了四个决定。

几乎不化妆、修身黑高领、平静的表情——提示词描述的是画面里有什么,不是它应该多好看。
一位年轻女性的电影感清冷肖像,皮肤白皙透亮,妆容若有若无,嘴唇自然温暖。深棕色长发松散垂落,质感柔软。神情平静自信。她穿着一件修身黑色高领毛衣,线条利落,低调优雅。深色极简背景逐渐融入黑暗。柔和漫射正面光,阴影柔和,微妙胶片颗粒感,有机色彩调校,浅景深,高端编辑质感。
错误 6:给了镜头,没给机位
机位是语料里最被忽略的一项控制。low angle 占 2.5%、eye level 1.4%、high angle 0.74%。而 close-up 有 9.3%——大家指定「切多紧」的频率远高于指定「相机站在哪」,可决定主体气质的恰恰是高度。
特写人像,50mm 镜头,构图好看
50mm, chest-up crop, camera slightly below eye level looking up, subject centred with negative space above the head

极端俯拍、全身、居中——机位本身就是这张图的全部创意。
{
"image_type": "摄影肖像",
“风格”:“影棚肖像、电影感、极简主义”,
“作品”: {
“方向”: “竖屏”
“构图”:“从极高角度拍摄的全身照”,
"subject_position": "居中",
"camera_angle": "俯视(鸟瞰/上方)",
"lens_distortion": "强烈的广角透视夸张",
"负空间": "大片的周围空白空间",
“视角”: “戏剧性的俯视视角,主体向上看”
},
“主题”: {
“计数”:1,
描述:戴眼镜的年轻人
“姿势”:“站直,肩膀略微前倾,手臂放松”,
“表情”:“柔和、内省、略带好奇心”
“凝视”:“直视镜头”,
“配件”: [
圆形眼镜
],
“衣服”: {
“外套”:“深棕色夹克”,
“内衣”: “浅色针织或纹理衬衫”,
风格:休闲、低调
}
},
"facial_details": {
“特征”:“圆脸,柔和的下颌线条”,
“情绪”:“平静,深思熟虑”,
"eye_emphasis": "因眼镜和向上凝视而增强"
},
“灯光”: {
类型: “影棚灯光”,
“设置”:“顶部中心柔光,逐渐衰减”,
“对比度”:“低到中等”,
“阴影”:“下巴和身体下方的微妙阴影”,
“渐晕”: “边缘逐渐变暗的强烈放射状渐晕”
},
“颜色”: {
“调色板”:[
“冷灰色”,
“木炭”,
“柔和的棕色”,
柔和米色
],
“温度”: “冷中性”
“饱和度”:“低”,
“情绪”:“安静,沉思”
},
“背景”: {
“环境”: “工作室”,
“表面”:“光滑无缝的地板”,
“渐变”: “从亮中心到暗边缘的径向渐变”,
“干扰因素”: “无”
},
"technical_details": {
"camera_type": "digital",
“镜头”:“超广角或鱼眼镜头式广角镜头”,
"depth_of_field": "deep (整个主体都清晰对焦)",
“锐度”:中心锐度高,边缘略微柔和,
“噪音”:“极小”,
“后处理”:[
“对比塑造”,
“冷色调分级”,
“场景增强”,
“透视夸张”
]
},
“artistic_elements”:{
“概念”:“通过规模和视角展现孤立和脆弱性”,
"视觉隐喻": "被广阔的空旷空间包围的小主体",
"aesthetic_influences": [
“编辑肖像摄影”,
“现代工作室极简主义”,
“电影式俯视构图”
]
},
"排版": {
“存在”:否
},
"overall_mood": "亲密、内省、略带超现实感"
"预期用途": [
“编辑肖像”,
“概念摄影参考资料”
“AI图像生成风格指南”
]
}错误 7:描述你不想要的东西
否定式写法逼模型先把你想排除的东西表示出来。而且它是多余的:每一个否定都有更具体的肯定形式。
不要人,不要模糊,不要文字,手不要奇怪,不要卡通
Empty street at dawn, sharp focus throughout, clean untextured surfaces, hands resting flat on the table in full view, photographic realism
错误 8:自相矛盾
物理上不兼容的指令,模型会挑一个执行,而挑哪个不由你决定。常见的几对:
| 矛盾 | 为什么解不开 | 二选一 |
|---|---|---|
24mm 广角 + 强烈虚化 | 广角景深天然更深,这是光学 | 要么广而深,要么长而浅 |
特写 + 全身 | 两种裁切 | close-up(9.3%)或 full body(3.3%) |
golden hour + overcast | 两种天空 | 暖而有方向,或平而柔 |
对称 + 三分法 | 两种放置 | symmetry 占 5.1%;要么居中要么偏置 |
抓拍、自然 + 直视镜头、摆姿势 | 两个瞬间 | 先决定主体知不知道镜头在 |
35mm wide angle shot, extreme close-up of her face, heavy bokeh, golden hour, overcast day
35mm, waist-up, subject two metres away, background compressed but still readable, late afternoon sun from behind camera left
错误 9:把活派给了错的模型
把同一份语料按运行模型拆开,专长分野一目了然:
| Nano Banana | GPT Image | Midjourney | |
|---|---|---|---|
| 语料条数 | 3,305 | 2,043 | 4,305 |
| 要求文字/排版 | 21.8% | 51.7% | 7.9% |
| 带摄影参数 | 45.5% | 28.0% | 9.6% |
| 要求插画/动漫 | 19.4% | 36.2% | 17.0% |
超过一半的 GPT Image 提示词要画面内出现文字,Midjourney 只有 7.9%。如果你的图需要一行能读的标题,选模型比写提示词更决定成败。

带堆叠大标题的封面图——这是排版活,被派给了大家信任排版的那个模型。
一张简洁现代的 YouTube 缩略图,采用明亮的白色背景,视觉上分为左侧的粗体文字和右侧的半身演示者。在左侧,放置一个巨大的堆叠式标题,使用加粗的黑色无衬线大写字母,内容为 CLAUDE DESIGN,左对齐并分两行显示。在其下方,添加一个带有细微投影的大型圆角橙色横幅,内含加粗的白色大写文字,并带有橙色轮廓,内容为 IN 6 MINS。在标题附近,加入 2 个橙色星爆形状,一个较小,位于文字旁,另一个较大,位于远处的背景右侧。在左下象限,展示一个设计工具仪表盘的悬浮应用界面模型,面板呈柔和的灰白色,带有细边框、圆角和淡淡的阴影。界面左侧边栏应包含 4 个菜单项,标签分别为:“Recent”、“Your designs”、“Examples” 和 “Design systems”。主面板标题应显示为 “Recent”,并包含 3 个网格排列的“项目”卡片,标签分别为:“Thumio Design System”、“Thumio Startup” 和 “Design System”。在右半部分,展示一位胸部以上的写实风格年轻男性,身穿白色高领毛衣,留着凌乱的浅棕色头发和浅浅的胡茬,位置靠近镜头。他的脸部被一个覆盖大部分区域的纯棕色矩形占位符刻意遮挡。他的一只手指向左侧的界面面板,手指伸出。采用温暖的橙白品牌配色,高对比度,极简布局,精致的创作者经济缩略图风格,带有细微阴影,构图专为科技教程内容设计。
完整拆解:Nano Banana vs GPT Image 和 Nano Banana vs Midjourney。
错误 10:抄提示词,却没改掉「只对原作者有效」的那部分
这一条要把真实提示词并排看才发现。有两样东西会跟着复制过来,并悄悄让它失效:
方括号占位符。 图库里大量提示词是当模板写的,留着 [BRAND NAME]、[FOOD]、[CITY] 这样的字段。原样粘贴,模型会把括号里的字画出来、自己编一个品牌,或者给你一个泛泛的替代品。

一条模板提示词:品牌名是留给你替换的方括号字段。
[品牌名称] 即将推出一款全新的功能性健康饮品(例如,具有适应原、益智或天然能量的饮料)。作为创意总监,请构思产品名称并构思一张完整的高端宣传照。美学风格为“宇宙级奢华”——科技感十足、简洁精致、高端大气,如同顶级苹果产品摄影作品。 产品:设计一款造型独特、多层结构的饮料瓶,瓶身悬浮于中央。造型充满未来感和工程感。材质触感极佳:喷砂钛金属细节、磨砂硼硅酸盐玻璃和纹理触感聚合物握把。 **关键颜色说明:**内装液体必须具有与其功能相符的独特、自然的颜色(例如,鲜艳的姜黄、深邃的浆果红、质朴的抹茶绿或宁静的浅蓝)。液体应呈现逼真的效果,并带有细微的天然沉淀。 **关键图形细节:**在瓶子的透明玻璃部分,印上一层简洁、极简的哑光白色技术字体。这种设计应兼具实用性和未来感(例如,“太空级配方”、“批次: OZ-9 ”等小型技术规格、容量指示或坐标标记),增添类似航空航天标签的功能美感,同时又不破坏瓶子简洁的线条。 环境与灯光:瓶子放置在一个无缝摄影棚内。 **关键背景说明:**背景必须是纯色、干净、非常浅的粉彩色调,并且要经过精心挑选以衬托液体颜色(例如,暖橙色液体搭配柔和的薄荷绿背景,或深绿色液体搭配淡粉色背景)。禁止使用渐变色。超柔和的漫射摄影棚灯光可以在金属表面营造出光滑的高光,并在玻璃和液体表面形成深邃的散射效果。 摄影风格:高分辨率100mm微距镜头拍摄。浅景深,清晰聚焦于瓶身纹理和玻璃上的印刷图案,柔和的粉彩背景虚化。8K分辨率,超逼真的纹理。 图形叠加层:包含微妙的深灰色用户界面元素。 左下角:非常小的极简文字(类似 Manrope Regular 字体),用两句话描述产品的名称和功能。 右下角:[品牌名称] 的小型、极简的深灰色标志。
绑账号的参数。 语料里的 Midjourney 提示词经常以 --profile wstgdj4 或 --sref 2143660546 结尾。profile 码指向的是那个人的个性化数据,--sref 指向一张特定的风格参考图。照抄等于在要别人的审美,却一点也没带过来——换到不认这些参数的平台上,则是完全无效。

六个词的主体 + 一个私人风格 profile。六个词能带走,profile 码带不走。
Sea, cat, orange warm bright light --ar 1:2 --profile wstgdj4
复用任何提示词之前:把所有方括号换掉、删掉属于别的平台的参数、再确认一下原图是不是有一张参考图在干文字没说的活。
一条同时避开十个坑的提示词
Subject: woman in her early thirties, shoulder-length dark hair pushed
behind one ear, no visible makeup, faint smile
Wardrobe: oversized ecru linen shirt, sleeves rolled to the elbow
Setting: kitchen table beside a north-facing window, mid-morning,
half-finished coffee and an open notebook in frame
Lighting: soft directional window light from camera left, white wall
bouncing a little fill into the shadow side, no artificial light
Camera: 50mm, f/2.0, eye level, waist-up, subject offset to the right
third with negative space to the left
Motion: caught mid-turn towards the window, not looking at the lens
Style: editorial documentary photography, fine natural grain,
neutral colour, skin texture preserved
九十词。它同时给了镜头和光圈、光线方向和质感、机位、裁切、一个瞬间,以及零个「应该多好看」的形容词。去生成器跑一遍,然后一次只改一行,你就能看出是哪个槽位在扛整张图。
常见问题
为什么我的 AI 图总和想象的不一样?
多数情况下是提示词只写了主体。我们 9,599 条语料里有五分之一不到 30 词,光线、镜头、构图、情绪全交给了默认值。先补一个光线方向和一行相机参数——这两处改动对画面的影响大于任何其他修改。
新手的提示词应该写多长?
目标 80–150 词。这是我们数据里中位互动跳台阶的位置(30–79 词区间中位浏览 5,80–149 词区间 19),也大致是「装得下主体、光线、相机、情绪且不注水」所需的长度。完整长度分析见《9,667 条提示词里到底写了什么》。
负面提示词(negative prompt)有用吗?
「写你不想要的」本身就是一条更弱的指令,而且各平台行为不一。把每个否定翻成肯定:把「不要模糊」写成 sharp focus throughout;把「手不要奇怪」写成手放在哪、在做什么。
为什么我抄来的提示词跑出来不一样?
通常三个原因:[BRAND NAME] 这类方括号占位符没替换;提示词里带着 --sref、--profile 这类只在 Midjourney 有意义的参数;或者原图用了一张文字里从未提及的参考图。我们图库里每条提示词都标了运行模型,前两个几秒钟就能核对。
新手该从哪个模型开始?
拍照类工作选 Nano Banana——语料里它 45.5% 的提示词带摄影参数,它就是被设计来「像给摄影师下 brief 一样用」的。画面里要有可读文字就选 GPT Image,它 51.7% 的提示词是文字任务。其余选择见《2026 AI 生图工具横评》。





