你的提示词写着"杰作",你的受众看到的是"假的"

上周二你发了一张生活照。提示词里写着:”Golden hour, shot on Canon R5, 85mm f/1.4, cinematic color grading, masterpiece, 8K。”脸很漂亮,皮肤无瑕,那种人人都爱的柔和轮廓光。三个赞。你朋友发了张俯拍桌面的糊图,角落里一棵半死不活的芦荟,猫尾巴横穿画面。十七个收藏。你点开她的文案:”救命,这就是我真实的工位现状,我已经快疯了。”没有提示词工程,没有”Unreal Engine render”。就是一部手机歪了几度拍的,因为她一只手端着手机、另一只手还在搅咖啡。

这不是质量差距。这是可信度差距,它有名字:大脑的那套”这张照片是不是一个跟我处境差不多的人拍的”启发式判断。这是社交内容 AI 图像提示词中最被忽视的一个变量。

信息流已经替你选好了相机

当一个人刷 Instagram Reels、小红书、TikTok 或者 Twitter/X 时间线时,她看的不是美术馆展墙。她看的是手机上一块 9:16 的矩形画面——在日光下,或者头顶日光灯下,或者晚上十一点被自己屏幕的蓝光映着脸的那种光线下。那个场景里”默认相机”就是一颗离脸几英寸的前置镜头,或者一只胳膊伸出去拍的后置镜头,稍微偏一点轴,没有灯光师。

你的图像不需要”美”。它需要的是与它出现的那个场景所暗示的拍摄条件保持一致。一张打光完美的 8K 人像,贴在一条手机随手拍和一条 Reel 旁边,读起来就是广告。在拇指还没划完之前,”跳过广告”的心理反射就已经触发了。这不是品味问题,是 200 毫秒内完成的模式匹配。

所以 AI 图像提示词的核心问题不是”什么相机能拍出最好看的画面?”而是”画面里这个人,此刻、在她坐的那个地方、往这个平台发帖时,她手里最合理的那台相机是哪一台?”这个答案决定了畸变、焦距、光照模型、构图偏差。全部。

那些告诉大脑”一个真人曾在这里”的线索

随便把一张照片丢进视觉-语言模型,让它列出”真实感”的证据。你会得到一份词汇表——大多数提示词作者把它当作该避免的词,实际上应该反过来当作该包含的词:

  • 镜头畸变。 前置摄像头在脸部中心周围产生广角拉伸,边缘向内弯曲。提示词里写”24mm 等效”甚至”wide-angle selfie distortion”,正在做一件再多”photorealistic”都做不到、也无法替代的事:把图像锚定在一颗特定的、廉价的光学器件上。
  • 生硬、无趣的光。 桌面上方那根日光灯管,从窗户单向打进来、没有补光、带着明显方向性阴影的日光,深夜笔记本屏幕在脸上一片平淡的蓝。这些是真实房间的光照条件。影棚柔光箱是产品详情页的光照条件。
  • 构图失误。 主体不在正中央。地平线微微倾斜。一根手指闯进了画面角落。人物头顶被裁掉了一点,因为拍照时她正在调角度。你可以用”slightly tilted composition, cropped head, finger edge visible in lower-left frame”来触发这些效果。
  • 运动模糊与噪点。 手指上几个像素的拖影,因为快门不够快。高 ISO 下可见的传感器颗粒。不是”film grain aesthetic”——是手机传感器在暗光下超出预算时那种特有的、块状的色度噪点。
  • 环境中的”乱”。 椅子上堆着衣服。一根充电线在桌面上蜿蜒。吃了一半的外卖。这些不是道具;它们是大脑把这张图归入”某人的周二”而非”某人的作品集”的理由。

以上任何一条都不要求你放弃审美意图。背景可以设计成乱。倾斜可以是刻意选择的倾斜。但提示词必须承诺”条件”,而不是承诺”精致”。

三个提示词,同一个主体,三种阅读

以下是同一场景的三组提示词骨架:一位二十七八岁的女性,黑色短发,坐在一张乱糟糟的办公桌前,面前一台笔记本电脑。把主体细节替换成你自己的 persona 形象即可。这套结构逻辑直接迁移到 Midjourney、DALL-E 3、Stable Diffusion XL 或任何能读自然语言提示词的模型。

Prompt A——没人看的那种: professional portrait photograph, woman late 20s short dark hair, sitting at desk with laptop, 85mm lens, f/1.4 bokeh, cinematic golden hour lighting, studio softbox key light, skin detail, 8K resolution, shot by Annie Leibovitz, magazine editorial, masterpiece

这会产出一张极其漂亮的图。它同时产出一张——被夹在一条手机随手拍和一条 Reel 之间时——读起来就是”品牌合作”的图。互动数据崩盘不是因为图不好,而是因为它声称的那台相机在这个语境下是一个谎。

Prompt B——迈了一半的那步: candid photo of a woman in her late twenties, short dark hair, working at a cluttered desk, laptop open, natural window light from the left, slight warm color cast, 35mm lens, shallow but present background blur, casual t-shirt, a half-eaten bowl of noodles beside her keyboard, shot on a mirrorless camera, unposed, slight film grain, muted tones

好一些了。光源现在只有一个,且方向是真实的。”unposed”和”muted tones”把色调拉向”生活化”。但”mirrorless camera”仍然暗示一台需要专门携带的机身,而 35mm 的取景对于一张桌面随手拍来说太整齐了。

Prompt C——让拇指停下来的那条: front camera selfie taken while sitting at a messy desk, woman late 20s short dark hair slightly off to the left of frame, laptop screen casting blue light on one side of her face, overhead kitchen fluorescent adding a greenish flat fill on the other, a charging cable and crumpled receipts visible, phone angle slightly tilted 4 degrees, wide-angle lens distortion around the nose, sensor noise in the shadows, one hand partially visible at the bottom edge, background is a white wall with a single thumbtack and a sticky note, natural skin texture with no retouching, slightly out of focus on the background, iPhone front camera photo, 2025

这不是一条让模型充当艺术家的提示词。它让模型充当一部手机。而在信息流里,这正是人们期待看到的东西。

从缩略图出发,反推相机

下面是我的工作流程,我真希望有人早一年、少让我交两百小时”masterpiece”提示词的学费就把它交到我手上:

  1. 先说出展示位置。 小红书一篇四千字长文的封面图?Instagram Story 的一帧?Twitter/X 引用推文的配图?平台已经替你选好了观看矩形,更关键的是——已经替你选好了预期相机。Story 就是手机拍的。信息流网格图相对宽容一些。博客头图可以多精致一档。
  2. 先说出观看者的姿态。 她是在通勤地铁上单手刷着碎屏手机,还是在办公桌前用大屏显示器休息时喝口咖啡的间隙?碎屏、单手、地铁摇晃——这种语境下,”制作感”和”生活感”之间的距离要拉到最大。27 寸显示器上的博客头图,构图上的容错空间就宽裕一些。
  3. 把相机当作约束来描述,再翻译成提示词 token。 “iPhone 前置摄像头、手臂距离、厨房头顶日光灯、轻微广角畸变、头顶被裁”——这不是限制,这是一份设计简报。先把简报写进提示词,再写主体描述。主体和场景是装在相机取景框里的,不是反过来。
  4. 删掉每一个暗示”制作”的词。 “Cinematic”“masterpiece”“editorial”“studio”“bokeh”“8K”“award-winning”、任何摄影师的名字。这些 token 会把输出从”手机照片”的分布推入”图库素材”的分布。如果你想要质感,写”sensor noise at ISO 1600”,而不是”film grain aesthetic”。

常见问题

我还能得到”有美感”的结果,同时不让整张图看起来很假吗? 能,但那个美感必须是手机自己的美感,不是调色师的。偏绿的日光灯色温、笔记本电脑屏幕打在皮肤上的冷蓝、厨房里略微发白的过曝——这些也是色彩方案。直接在提示词里描述它们(”mixed color temperature, warm overhead green and cool screen blue”)。最终效果比又一张 teal-and-orange 电影级调色更有趣。

博客或商业计划书的头图也适用这套逻辑吗? 部分适用。博客头图对精致度的容忍更高,因为观看语境(一个刻意打开的阅读页面)已经让读者做好了接受”制作过的图像”的心理准备。商业计划书更是宽容得多。”素人感”策略是专门针对信息流语境的——图像出现在一千张手机随拍旁边。独立的落地页或个人作品集,规则可以放松。

如果我需要一张明显是”我”的 persona 脸,但前置摄像头的畸变让我的五官看起来不对怎么办? 畸变本身就是重点。前置摄像头会让你的鼻子显大、额头显窄。你的粉丝早就把这张脸和那个几何比例关联在一起了,因为你自拍时就是那个样子。一条把五官磨成”美颜相机”比例的提示词,产出的脸会被受众的模式匹配器标记为”不是她”。你可以用”50mm equivalent”来减轻畸变,但不要完全消除鼻子那一丁点的宽度拉伸。

我试了 Prompt C 那种写法,模型给我出了一张真正难看、噪点泛滥的图。怎么保持”真实”的同时还能看? “真实”≠”难看”。手机照片里的噪点是阴影区域低水平的色度噪点,不是整幅画面蒙一层灰雾。指定噪点在哪里:”luminance noise in shadow areas only, clean highlights”。指定倾斜在哪里:”slight tilt, subject’s face still well within frame”。目标是”一两个瑕疵”,不是全面降质。一个倾斜的地平线加一个乱糟糟的背景加一根充电线,已经是三条真实性信号了。你不需要再把主体也糊掉。


下次你打开一个提示词窗口准备做封面图时,你敲下的第一句话不应该描述你的主体。它应该描述主体手里那部手机、头顶那盏灯、以及画面为什么没有摆正。其他一切,都装在这些约束里面。”素人感”不是妥协。在信息流里,它是你的受众唯一会读的语言。