上周二你发了一张生活照。提示词里写着："Golden hour, shot on Canon R5, 85mm f/1.4, cinematic color grading, masterpiece, 8K。"脸很漂亮，皮肤无瑕，那种人人都爱的柔和轮廓光。三个赞。你朋友发了张俯拍桌面的糊图，角落里一棵半死不活的芦荟，猫尾巴横穿画面。十七个收藏。你点开她的文案："救命，这就是我真实的工位现状，我已经快疯了。"没有提示词工程，没有"Unreal Engine render"。就是一部手机歪了几度拍的，因为她一只手端着手机、另一只手还在搅咖啡。

这不是质量差距。这是可信度差距，它有名字：大脑的那套"这张照片是不是一个跟我处境差不多的人拍的"启发式判断。这是社交内容 AI 图像提示词中最被忽视的一个变量。

## 信息流已经替你选好了相机

当一个人刷 Instagram Reels、小红书、TikTok 或者 Twitter/X 时间线时，她看的不是美术馆展墙。她看的是手机上一块 9:16 的矩形画面——在日光下，或者头顶日光灯下，或者晚上十一点被自己屏幕的蓝光映着脸的那种光线下。那个场景里"默认相机"就是一颗离脸几英寸的前置镜头，或者一只胳膊伸出去拍的后置镜头，稍微偏一点轴，没有灯光师。

你的图像不需要"美"。它需要的是*与它出现的那个场景所暗示的拍摄条件保持一致。*一张打光完美的 8K 人像，贴在一条手机随手拍和一条 Reel 旁边，读起来就是广告。在拇指还没划完之前，"跳过广告"的心理反射就已经触发了。这不是品味问题，是 200 毫秒内完成的模式匹配。

所以 AI 图像提示词的核心问题不是"什么相机能拍出最好看的画面？"而是"画面里这个人，此刻、在她坐的那个地方、往这个平台发帖时，她手里最合理的那台相机是哪一台？"这个答案决定了畸变、焦距、光照模型、构图偏差。全部。

## 那些告诉大脑"一个真人曾在这里"的线索

随便把一张照片丢进视觉-语言模型，让它列出"真实感"的证据。你会得到一份词汇表——大多数提示词作者把它当作*该避免的*词，实际上应该反过来当作*该包含的*词：

- **镜头畸变。** 前置摄像头在脸部中心周围产生广角拉伸，边缘向内弯曲。提示词里写"24mm 等效"甚至"wide-angle selfie distortion"，正在做一件再多"photorealistic"都做不到、也无法替代的事：把图像锚定在一颗特定的、廉价的光学器件上。
- **生硬、无趣的光。** 桌面上方那根日光灯管，从窗户单向打进来、没有补光、带着明显方向性阴影的日光，深夜笔记本屏幕在脸上一片平淡的蓝。这些是真实房间的光照条件。影棚柔光箱是产品详情页的光照条件。
- **构图失误。** 主体不在正中央。地平线微微倾斜。一根手指闯进了画面角落。人物头顶被裁掉了一点，因为拍照时她正在调角度。你可以用"slightly tilted composition, cropped head, finger edge visible in lower-left frame"来触发这些效果。
- **运动模糊与噪点。** 手指上几个像素的拖影，因为快门不够快。高 ISO 下可见的传感器颗粒。不是"film grain aesthetic"——是手机传感器在暗光下超出预算时那种特有的、块状的色度噪点。
- **环境中的"乱"。** 椅子上堆着衣服。一根充电线在桌面上蜿蜒。吃了一半的外卖。这些不是道具；它们是大脑把这张图归入"某人的周二"而非"某人的作品集"的理由。

以上任何一条都不要求你放弃审美意图。背景可以*设计成*乱。倾斜可以是*刻意选择*的倾斜。但提示词必须承诺"条件"，而不是承诺"精致"。

## 三个提示词，同一个主体，三种阅读

以下是同一场景的三组提示词骨架：一位二十七八岁的女性，黑色短发，坐在一张乱糟糟的办公桌前，面前一台笔记本电脑。把主体细节替换成你自己的 persona 形象即可。这套结构逻辑直接迁移到 Midjourney、DALL-E 3、Stable Diffusion XL 或任何能读自然语言提示词的模型。

**Prompt A——没人看的那种：**
`professional portrait photograph, woman late 20s short dark hair, sitting at desk with laptop, 85mm lens, f/1.4 bokeh, cinematic golden hour lighting, studio softbox key light, skin detail, 8K resolution, shot by Annie Leibovitz, magazine editorial, masterpiece`

这会产出一张极其漂亮的图。它同时产出一张——被夹在一条手机随手拍和一条 Reel 之间时——读起来就是"品牌合作"的图。互动数据崩盘不是因为图不好，而是因为它声称的那台相机在这个语境下是一个谎。

**Prompt B——迈了一半的那步：**
`candid photo of a woman in her late twenties, short dark hair, working at a cluttered desk, laptop open, natural window light from the left, slight warm color cast, 35mm lens, shallow but present background blur, casual t-shirt, a half-eaten bowl of noodles beside her keyboard, shot on a mirrorless camera, unposed, slight film grain, muted tones`

好一些了。光源现在只有一个，且方向是真实的。"unposed"和"muted tones"把色调拉向"生活化"。但"mirrorless camera"仍然暗示一台需要专门携带的机身，而 35mm 的取景对于一张桌面随手拍来说太整齐了。

**Prompt C——让拇指停下来的那条：**
`front camera selfie taken while sitting at a messy desk, woman late 20s short dark hair slightly off to the left of frame, laptop screen casting blue light on one side of her face, overhead kitchen fluorescent adding a greenish flat fill on the other, a charging cable and crumpled receipts visible, phone angle slightly tilted 4 degrees, wide-angle lens distortion around the nose, sensor noise in the shadows, one hand partially visible at the bottom edge, background is a white wall with a single thumbtack and a sticky note, natural skin texture with no retouching, slightly out of focus on the background, iPhone front camera photo, 2025`

这不是一条让模型充当艺术家的提示词。它让模型充当一部手机。而在信息流里，这正是人们期待看到的东西。

## 从缩略图出发，反推相机

下面是我的工作流程，我真希望有人早一年、少让我交两百小时"masterpiece"提示词的学费就把它交到我手上：

1. **先说出展示位置。** 小红书一篇四千字长文的封面图？Instagram Story 的一帧？Twitter/X 引用推文的配图？平台已经替你选好了观看矩形，更关键的是——已经替你选好了*预期相机*。Story 就是手机拍的。信息流网格图相对宽容一些。博客头图可以多精致一档。
2. **先说出观看者的姿态。** 她是在通勤地铁上单手刷着碎屏手机，还是在办公桌前用大屏显示器休息时喝口咖啡的间隙？碎屏、单手、地铁摇晃——这种语境下，"制作感"和"生活感"之间的距离要拉到最大。27 寸显示器上的博客头图，构图上的容错空间就宽裕一些。
3. **把相机当作约束来描述，再翻译成提示词 token。** "iPhone 前置摄像头、手臂距离、厨房头顶日光灯、轻微广角畸变、头顶被裁"——这不是限制，这是一份设计简报。先把简报写进提示词，再写主体描述。主体和场景是*装在相机取景框里*的，不是反过来。
4. **删掉每一个暗示"制作"的词。** "Cinematic""masterpiece""editorial""studio""bokeh""8K""award-winning"、任何摄影师的名字。这些 token 会把输出从"手机照片"的分布推入"图库素材"的分布。如果你想要质感，写"sensor noise at ISO 1600"，而不是"film grain aesthetic"。

## 常见问题

**我还能得到"有美感"的结果，同时不让整张图看起来很假吗？**
能，但那个美感必须是*手机自己的*美感，不是调色师的。偏绿的日光灯色温、笔记本电脑屏幕打在皮肤上的冷蓝、厨房里略微发白的过曝——这些也是色彩方案。直接在提示词里描述它们（"mixed color temperature, warm overhead green and cool screen blue"）。最终效果比又一张 teal-and-orange 电影级调色更有趣。

**博客或商业计划书的头图也适用这套逻辑吗？**
部分适用。博客头图对精致度的容忍更高，因为观看语境（一个刻意打开的阅读页面）已经让读者做好了接受"制作过的图像"的心理准备。商业计划书更是宽容得多。"素人感"策略是专门针对*信息流语境*的——图像出现在一千张手机随拍旁边。独立的落地页或个人作品集，规则可以放松。

**如果我需要一张明显是"我"的 persona 脸，但前置摄像头的畸变让我的五官看起来不对怎么办？**
畸变本身就是重点。前置摄像头会让你的鼻子显大、额头显窄。你的粉丝早就把这张脸和*那个*几何比例关联在一起了，因为你自拍时就是那个样子。一条把五官磨成"美颜相机"比例的提示词，产出的脸会被受众的模式匹配器标记为"不是她"。你可以用"50mm equivalent"来减轻畸变，但不要完全消除鼻子那一丁点的宽度拉伸。

**我试了 Prompt C 那种写法，模型给我出了一张真正难看、噪点泛滥的图。怎么保持"真实"的同时还能看？**
"真实"≠"难看"。手机照片里的噪点是阴影区域低水平的色度噪点，不是整幅画面蒙一层灰雾。指定噪点*在哪里*："luminance noise in shadow areas only, clean highlights"。指定倾斜*在哪里*："slight tilt, subject's face still well within frame"。目标是"一两个瑕疵"，不是全面降质。一个倾斜的地平线加一个乱糟糟的背景加一根充电线，已经是三条真实性信号了。你不需要再把主体也糊掉。

---

下次你打开一个提示词窗口准备做封面图时，你敲下的第一句话不应该描述你的主体。它应该描述主体手里那部手机、头顶那盏灯、以及画面为什么没有摆正。其他一切，都装在这些约束里面。"素人感"不是妥协。在信息流里，它是你的受众唯一会读的语言。