真正获得点击的 AI YouTube 缩略图
使用 AI 设计吸引眼球的 YouTube 缩略图,提高点击率。学习构图、颜色和文字放置的秘诀。
本页目录
第一个决定是选模型,不是写提示词
封面上几乎一定有字,而"把可读的字放进生成的图里"恰好是各家模型差距最大的一件事。模型选错,你会用二十次生成去和一堆残缺的字母搏斗,而任何措辞都救不回来。
该选哪个,答案就在我们自己的语料里:在 LocalBanana 图库的 9,599 条已发布提示词中,GPT Image 有 51.7% 的提示词要求文字或排版——是 Nano Banana(21.8%)的 2.4 倍,是 Midjourney(7.9%)的六倍以上。 用户早就用提示词投过票了。这篇讲怎么照着这个结论做,以及决定成品能不能在信息流尺寸下活下来的那几条构图规则。
谁被要求写字
51.7%
语料中 2,043 条
21.8%
语料中 3,305 条——频率低 2.4 倍
7.9%
语料中 4,305 条——大幅垫底
这是一份大规模真实语料体现出的偏好,不是实验室跑分:它测的是人们在摸清各模型擅长什么之后,实际把什么活交给了谁。但这个分野大得惊人,也和任何试过让模型渲染一行标题的人的体感一致。封面这种"职责里就包含排字"的图,请从 GPT Image 起步,可以先翻 GPT Image 提示词合集里已经成立的版式。
一条真正能用的封面提示词长这样。点开完整读一遍:标题被逐字写死,横幅的颜色被点名,出镜的人被描述成一个裁切位置,而不是一种情绪。

一张 16:9 封面,版面对半分——左边是粗重的堆叠标题,右边是被裁切的出镜者,背景是明亮平涂色。每一处文字都被逐字指定。
一张简洁现代的 YouTube 缩略图,采用明亮的白色背景,视觉上分为左侧的粗体文字和右侧的半身演示者。在左侧,放置一个巨大的堆叠式标题,使用加粗的黑色无衬线大写字母,内容为 CLAUDE DESIGN,左对齐并分两行显示。在其下方,添加一个带有细微投影的大型圆角橙色横幅,内含加粗的白色大写文字,并带有橙色轮廓,内容为 IN 6 MINS。在标题附近,加入 2 个橙色星爆形状,一个较小,位于文字旁,另一个较大,位于远处的背景右侧。在左下象限,展示一个设计工具仪表盘的悬浮应用界面模型,面板呈柔和的灰白色,带有细边框、圆角和淡淡的阴影。界面左侧边栏应包含 4 个菜单项,标签分别为:“Recent”、“Your designs”、“Examples” 和 “Design systems”。主面板标题应显示为 “Recent”,并包含 3 个网格排列的“项目”卡片,标签分别为:“Thumio Design System”、“Thumio Startup” 和 “Design System”。在右半部分,展示一位胸部以上的写实风格年轻男性,身穿白色高领毛衣,留着凌乱的浅棕色头发和浅浅的胡茬,位置靠近镜头。他的脸部被一个覆盖大部分区域的纯棕色矩形占位符刻意遮挡。他的一只手指向左侧的界面面板,手指伸出。采用温暖的橙白品牌配色,高对比度,极简布局,精致的创作者经济缩略图风格,带有细微阴影,构图专为科技教程内容设计。
指甲盖测试
在做别的之前,先把候选封面缩到大约一个指甲盖那么宽——手机上搜索结果和推荐栏里,它到达的大致就是这个尺寸。你精雕细琢的东西在这个尺寸下几乎全消失,只有三件事决定它能不能活:
- 一个焦点。 两个互相竞争的主体会糊成一团。选脸或者选物,不要等权重地都要。
- 最多四个字(英文四个词)。 不是每行四个,是总共四个。每多一个字,字号就小一圈。
- 和界面分离。 App 在浅色模式下是白的,深色模式下接近黑。一张建立在纯白或近黑之上的封面,对一半观众来说会和页面融为一体。高饱和的中间调背景——浓黄、正红、青绿、橙——在两种模式下都守得住边界。
最后这条是大多数 AI 封面翻车的地方,因为 "cinematic""moody"——多数生图模型的默认审美——产出的恰恰是那种在深色信息流里消失的暗调低对比画面。
youtube thumbnail, shocked man, cinematic lighting, dramatic, 4k, eye-catching, viral
16:9 thumbnail, close-up of a man with a shocked open-mouth expression filling the right half of the frame, flat saturated yellow background, left half left empty for text, hard even lighting on the face, bold high contrast, no text in the image
三元素结构,以及界面会吃掉你哪一块
把一张成立的封面拆开,通常正好是三样东西:一个主体(情绪锚点)、一个物件(视频在讲什么)、以及一个隐含的问题——只有点进去才能解决的视觉张力。两个元素显得空,四个在指甲盖尺寸下糊成一片。
然后要绕开 YouTube 自己盖上去的东西:时长角标在右下角,而观众看过一部分之后,底边还会压上一条红色进度条。所以:右下角不放重要内容,底部那一条也不放。 标题放在上方三分之二,主体的眼睛靠近上三分之一——视线第一落点在那里。
Composition rules to paste into any thumbnail prompt:
16:9. Subject occupies [LEFT / RIGHT] half of the frame, cropped at [CHEST / SHOULDERS].
The opposite half is deliberately empty for a headline. Eyes positioned in the upper
third. Bottom-right corner kept clear and low-detail. Bottom strip free of any
important element. Flat saturated background colour, strong separation between
subject and background, no dark vignette.
把字写出来,不要描述它
封面文字出错最大的单一原因,是提示词在描述文字而不是给出文字。"加一句吸引人的标题"等于同时给了模型一个写作任务和一个渲染任务,它两个都会搞砸。
请逐字给出,加引号,并指定处理方式:
The headline reads exactly: "STOP DOING THIS"
Rendered in heavy uppercase sans-serif, three words stacked on three lines,
aligned top-left, white text with a thick black outline, occupying the left
third of the frame. No other text anywhere in the image. Do not add
subtitles, captions, watermarks or logos.
其中四个细节在真正干活:reads exactly 加引号、把字数写成一个数字、指定对齐与位置、以及明令禁止额外文字——因为模型很爱替你加一行你没要的副标题。
版面逻辑从信息图里偷
最有用的封面参考不是别的封面,而是密集信息图的提示词——因为层级问题在那里已经被解决过了:一个主角元素、围绕它排布的带标签注释、以及一条关于"谁有资格争夺注意力"的严格规则。

一个主角物件,信息以刻意非线性的方式绕着它流动。那条层级指令——主角优先,其余一律绕行——正是封面需要的。
超简洁现代(食品名称)信息图,高端编辑风格。将成品作为主角展示——新鲜烘焙、切片、摆盘,以三分之四倾斜角度微微漂浮,配以柔和自然的工作室灯光和微妙投影。采用动态非线性布局,让食材、步骤和信息围绕汉堡流动,而非自上而下。 食材区:简洁矢量图标或迷你插图配以名称和用量,以簇状或圆形流动排列,与菜品视觉相连。 步骤区:带编号的面板,用箭头或线条形成逻辑路径,包含小型烹饪图标(刀、碗、烤箱、计时器)。使用柔和渐变或轻玻璃态面板。 可选信息:卡路里、准备时间、烹饪时间、份数、辛辣度以极简徽章或气泡形式显示在菜品附近。 风格融合生活美食摄影与编辑信息图设计——鲜艳自然色彩、现代无衬线字体、清晰层次、充足留白。极简纹理或渐变背景。输出1080×1080,超清晰,社交媒体优化,无水印。

爆炸式版面,带标签的浮动元素按固定的顺时针顺序排列。注意提示词是**给每个元素指派位置**,而不是指望模型排得好看。
超现实家庭时尚信息图表摄影,父亲、母亲和女儿穿着协调的休闲服装,以平衡的圆形爆炸构图排列。 悬浮元素围绕三人顺时针组织: • 父亲:中性棒球帽、经典腕表、棉质圆领T恤、轻便休闲夹克、修身牛仔长裤、皮质腰带、踝袜、白色运动鞋。 • 母亲:柔软针织帽、极简金耳环、宽松棉质上衣、短款牛仔或亚麻夹克、高腰牛仔裤、皮质腰带、简洁运动鞋、结构感迷你手提包。 • 女儿:趣味发饰、柔软棉质T恤、浅色牛仔夹克、弹力牛仔裤、踝袜、柔和色运动鞋、迷你背包。 每件服装悬浮空中,以细点引导线连接回对应家庭成员。 极简编辑标签突出面料、颜色和材质细节(棉、牛仔、皮革、橡胶鞋底)。 干净工作室背景,带微妙渐变。 柔和漫射照明营造温暖、健康氛围。 高端生活方式编辑造型,超锐利对焦,自然肤色,8K品质,高端时尚目录美学。
下面三条都是围绕大量文字和版面构建的。前两条跑在 GPT Image 上,第三条跑在 Nano Banana 上——对比各自的字撑得住撑不住。
三个封面模板
反应 / 人脸主导
16:9 YouTube thumbnail. Close-up of [PERSON] with a [SPECIFIC EXPRESSION: shocked
open mouth / narrowed sceptical eyes / wide delighted grin], head and shoulders
filling the right half of the frame, eyes in the upper third. Holding [OBJECT] up
toward the camera at chest height. Flat saturated [COLOUR] background, no gradient,
no vignette. Hard even lighting on the face, strong rim separation from the
background. Left half of the frame deliberately empty for a headline.
Bottom-right corner clear. No text in the image. Bold, high contrast.
教程 / 清单
16:9 YouTube thumbnail. [OBJECT OR SCREEN] centred and enlarged, shown at a slight
three-quarter angle with a soft drop shadow. Background: flat [COLOUR] with a
subtle paper texture. Top-left carries the headline, which reads exactly:
"[3-4 WORDS]" in heavy uppercase sans-serif, white with a thick dark outline.
One [ARROW / CIRCLE] annotation in bright [ACCENT COLOUR] pointing at [DETAIL].
No other text. Bottom strip and bottom-right corner kept clear and low-detail.
对比 / 谁更强
16:9 YouTube thumbnail split vertically down the middle by a hard diagonal edge.
Left side: [SUBJECT A] on a flat [COLOUR A] background. Right side: [SUBJECT B] on
a flat [COLOUR B] background. Both subjects at the same scale and eye level,
facing each other. A single bold "VS" in the centre where the two halves meet,
heavy uppercase, white with a dark outline. No other text anywhere.
High contrast, saturated colours, no gradients, bottom-right corner clear.
任选一份粘进生成器,填上方括号,按 16:9 生成。
更多文字与版面类提示词
常见问题
YouTube 封面该做多大?
16:9,导出 1280×720 或更大——这是标准尺寸;而且按 16:9 原生生成、而不是把方图裁成宽图,能保住你的构图。上传前去 YouTube 官方帮助页确认当前的文件大小与格式限制,那些条目会变。
做 YouTube 封面用哪个 AI 模型?
如果图本身必须承载文字,用 GPT Image:我们语料里它有 51.7% 的提示词要求文字或排版,是 Nano Banana(21.8%)的 2.4 倍,远高于 Midjourney(7.9%)。如果封面是摄影主体、文字后期在编辑器里加,那么照片那一半交给 Nano Banana 更强——它有 45.5% 的提示词带摄影参数。逐模型的完整拆解见《9,667 条已发布 AI 提示词里到底有什么》,更宽的工具横评见《2026 AI 生图工具对比》。
为什么 AI 老是把我的封面文字拼错?
通常是三个原因:你在描述文字而不是给出原文、你要的字太多、或者你用了一个本来就很少有人拿来排版的模型。请写 The headline reads exactly: "...",控制在四个词以内,指定大小写和字重,并补一句 "no other text anywhere in the image"。如果还是错,重跑而不是修补——也可以干脆把文字区留空,字在编辑器里打。
封面能用我自己的脸吗?
能——上传参考照片,并加上身份保持指令("preserve facial features exactly, do not alter the face"),然后描述你要的表情和裁切。图库里很多提示词就是这么写的。而"表情可以指定"正是价值所在:你能拿到那个精确的眉毛位置,否则要自拍十几次才能碰上。
为什么封面在编辑器里很好看,进了信息流就很难看?
因为你是放大了、在白底页面上、单独看的。把它缩到指甲盖宽,分别放在白色和近黑背景上看,再把它和五张竞争封面并排。到这一步还翻车的,多半仍是那三样:不止一个焦点、字太多、以及一个和界面融为一体的暗调或惨白背景。







