先週火曜、あなたはライフスタイル画像をひとつ投稿した。「Golden hour, shot on Canon R5, 85mm f/1.4, cinematic color grading, masterpiece, 8K」。美しい顔、完璧な肌、誰もが好きなあのソフトなリムライト。いいねは3件。友だちは、真上から撮ったブレブレのデスク写真を出した。隅に枯れかけの多肉、フレームを横切る猫の尻尾。キャプションは「まじで今この机で作業してて無理」。保存が17件。プロンプトエンジニアリングなんてしてない。「Unreal Engineでレンダリング」もない。ただコーヒーをかき混ぜながら、スマホを少し傾けただけ。
これは品質の差じゃない。信頼の差だ。しかもこれには名前がある——脳内にある「この写真、自分と似た状況の人間が撮ったか」ヒューリスティック。SNS向けAI画像プロンプトで最も無視されている変数がこれ。
フィードはもうカメラを決めている
誰かがInstagram Reels、小紅書、TikTok、Twitter/Xのタイムラインをスクロールするとき、そこはギャラリーの壁じゃない。スマホの9:16長方形、日中か蛍光灯の下か深夜11時の自画面の青白さの下。その文脈で「期待されるカメラ」は、顔から数センチのフロントカメラ、あるいはアームレングスで少し軸がずれたバックカメラ。照明クルーはいない。
画像は「美しい」必要はない。必要なのは、表示される文脈が暗示する撮影条件との一貫性だ。8Kの完璧に照らされたポートレートが、スマホスナップの隣に貼られたら、それは広告と映る。親指がフリックを終える前に「広告拒否」のブレーキがかかる。これは味のいい悪いいじゃなくて、200ミリ秒未満で走るパターンマッチングだ。
だからAI画像プロンプトの核心は「一番きれいに写るカメラはどれ?」じゃない。「この画像の人物が、今、この椅子に座ったまま、このプラットフォームに投稿するとして、手にしているのはどんなカメラか?」。その答えが歪みを決め、焦点距離を決め、ライティングモデルを決め、フレーミングのズレを決める。全部。
「人が写っていた」ことを示す手がかり
どんな写真でもVLM(視覚言語モデル)にかけて「真正性の証」を列挙させろ。出てくる語彙のほとんどは、プロンプターが「避けるべき語」として扱っているもの——その逆を「入れるべき語」にすればいい。
- レンズ歪み。 フロントカメラは顔の中心を広角に引っ張り、縁を曲げる。「24mm相当」や「ワイド角セルフィー歪み」をプロンプトに入れると、”photorealistic”を何百回書いても無理なことが一つ実現する——安価で特定の光学デバイスという文脈への接地だ。
- 硬くて退屈な光。 デスクのヘッド照明、片側だけ影が出てフィルライトなしの窓光、夜にノートPC画面が顔に当てるフラットな青。これらは「実際の部屋」の光だ。スタジオソフトボックスは「商品ページ」の光。
- フレーミングのミス。 主役は中央にいない。地平線が少し傾いている。角に指が入っている。アングルを調整中だから額が切れている。プロンプトには「slightly tilted composition, cropped head, finger edge visible in lower-left frame」と書ける。
- ブレとノイズ。 シャッターが遅いから手元が数ピクセル流れている。高ISO時のセンサーグレイン。「フィルムグレイン風」じゃなくて、スマホセンサーが低光量でコスト超えしたときの、あの塊状のクロマノイズ。
- 文脈の散らかし。 椅子に洗濯物。デスクを横切る充電ケーブル。途中でやめた食事。これらは小道具じゃない。「誰かのポートフォリオ」じゃなくて「誰かの火曜日」と脳がフォルダ分けする理由だ。
どれひとつとして「美的意図を捨てろ」とは言っていない。雑多な背景は意図的に雑多に組める。傾きは選んだ傾きだ。ただしプロンプトは仕上がりじゃなく条件にコミットすること。
同じ被写体、三つのプロンプト、三つの読み方
以下は同じシーンのプロンプト骨格。20代後半の女性、ショートヘア、散らかったデスクでノートPCを前に。被写体の詳細は自分のペルソナに置き換えていい。構造論理はそのままMidjourney、DALL-E 3、Stable Diffusion XL、自然言語プロンプトを読むモデルならどれでも通る。
Prompt A ——スベるやつ:
professional portrait photograph, woman late 20s short dark hair, sitting at desk with laptop, 85mm lens, f/1.4 bokeh, cinematic golden hour lighting, studio softbox key light, skin detail, 8K resolution, shot by Annie Leibovitz, magazine editorial, masterpiece
結果は美しい画像になる。そしてタイムラインでスマホスナップとReelの間に置かれたとき「案件」と映る画像でもある。エンゲージメントが沈むのは画像がダメだからじゃない。この文脈で「声明したカメラ」が嘘だからだ。
Prompt B ——中途半端な一手:
candid photo of a woman in her late twenties, short dark hair, working at a cluttered desk, laptop open, natural window light from the left, slight warm color cast, 35mm lens, shallow but present background blur, casual t-shirt, a half-eaten bowl of noodles beside her keyboard, shot on a mirrorless camera, unposed, slight film grain, muted tones
マシだ。光源が単一で方向がリアルになった。”unposed”と”muted tones”で色調が「暮らしてる」寄りに動く。ただ”mirrorless camera”はまだ「わざわざ携えた専用ボディ」を暗示するし、35mmのフレーミングはデスクスナップにしては整理されすぎている。
Prompt C ——親指が止まるやつ:
front camera selfie taken while sitting at a messy desk, woman late 20s short dark hair slightly off to the left of frame, laptop screen casting blue light on one side of her face, overhead kitchen fluorescent adding a greenish flat fill on the other, a charging cable and crumpled receipts visible, phone angle slightly tilted 4 degrees, wide-angle lens distortion around the nose, sensor noise in the shadows, one hand partially visible at the bottom edge, background is a white wall with a single thumbtack and a sticky note, natural skin texture with no retouching, slightly out of focus on the background, iPhone front camera photo, 2025
これはモデルにアーティストの役割を頼むプロンプトじゃない。モデルにスマホの役割を頼むプロンプトだ。タイムラインでは、それがまさに人間が見たいもの。
サムネイルから逆算してカメラを選ぶ
僕が使うワークフロー。一年前、あるいは「masterpiece」プロンプト二百時間前に誰かがこれを渡してくれてたらよかったのに、という手順:
- 置き場所を名指す。 4000字の小紅書ポストの表紙画像? Instagramストーリー? Twitter/Xの引用ポスト挿絵? プラットフォームが閲覧矩形と、決定的に期待されるカメラを先に選んでいる。ストーリーはスマホ撮り前提。フィードグリッドはもう少し許容。ブログのヒーロー画像は一段だけ磨いていい。
- 見る人の姿勢を名指す。 通勤電車で片手、割れた画面を凝視中? 休憩中のデスクトップモニター? 「割れた画面・片手スクロール」の文脈は、”作り物”と”生活感”の差を最大限に要求する。27インチのブログヒーローなら、もう少し構図の自由がある。
- カメラを制約として名指し、プロンプトトークンに翻訳する。 “iPhone front camera, arm’s length, kitchen overhead fluorescent, slight wide-angle distortion, cropped at forehead” は制約じゃない。デザインブリーフだ。このブリーフを被写体記述より先に書く。被写体と背景はカメラフレームの内側に置く。逆じゃない。
- 「制作感」を放つ語を全部削る。 “cinematic”“masterpiece”“editorial”“studio”“bokeh”“8K”“award-winning”、カメラマンの名前。これらは出力をスマホ写真の分布からストックライブラリの分布へ押し出すトークンだ。質感が欲しければ”film grain aesthetic”ではなく”sensor noise at ISO 1600”。
FAQ
「盛った感」を出さずに、ちゃんと”映える”画像は作れますか? はい。ただし”映え”はスマホの映えであって、カラーリストの映えじゃない。緑っぽい蛍光灯の_cast、肌に当たるノートPCの青、台所の少し褪せた白——これらはパレットだ。直接プロンプトに書く(”mixed color temperature, warm overhead green and cool screen blue”)。結果はティール・アンド・オレンジの「シネマティック」カラーグレーディングより視覚的に面白い。
ブログやピッチデッキのヒーロー画像にも有効ですか? 部分的に。ブログヒーローは磨きへの耐性が少し高い。閲覧文脈(能動的な読書ページ)が「作られた画像」を許容するよう読み手をプリミングしているから。ピッチデッキはさらに寛容。この「素人感」戦略はフィード文脈専用だ。スマホで撮った千の隣人の中に画像が現れる場所。単独のランディングページやポートフォリオなら、ルールは緩む。
ペルソナ用に「明らかに自分の顔」が必要だけど、フロントカメラ歪みで顔が崩れて見える場合は? その歪みが要点です。フロントカメラは鼻を大きく、額を狭く見せる。フォロワーはあなたの顔をあのジオメトリと結びつけている。セルフィーでいつもそう見えているから。”beauty-camera”ジオメトリに滑らかにしたプロンプトは、パターンマッチャーが「他人」とフラグする顔を生む。歪みは”50mm equivalent”で抑えられる。でも鼻幅の軽い拉伸までゼロにしないこと。
Prompt C方式でやったら、モデルがガチで汚い、ノイズ過多の画像を出しました。「リアル」と「見られる品質」を両立するには? リアル ≠ 汚い。スマホ写真のノイズは影の領域に低レベルで乗るクロマノイズだ、フレーム全体を覆う灰色の霧じゃない。ノイズの居場所を指定する:「luminance noise in shadow areas only, clean highlights」。傾きの居場所も指定する:「slight tilt, subject’s face still well within frame」。狙いは一つ二つの”欠点”であって、全面的な劣化じゃない。傾いた地平線+雑多な背景+充電ケーブルで、もう三つ目の真正性シグナル。被写体をわざわざボカす必要はない。
次にカバー画像のプロンプトウィンドウを開いたら、最初に打つ一文は被写体の説明じゃない。その人物が手にしているスマホ、頭上の光、フレームが真っ直ぐじゃない理由を書け。あとは全部その制約の中に収まる。”素人感”は妥協じゃない。フィードでは、それが視聴者の親指が流暢に話す唯一の言語だ。