Vous avez posté une image lifestyle mardi dernier. « Heure dorée, photo prise sur un Canon R5, 85 mm f/1/1,4, étalonnage cinématographique, chef-d'œuvre, 8K. » Un joli visage, une peau parfaite, cette douce lumière de contour que tout le monde adore. Trois likes. Votre amie a posté une photo floue, vue de dessus, de son bureau avec une plante grasse à moitié morte dans un coin et la queue de son chat traversant le cadre. Dix-sept enregistrements. Vous avez lu sa légende : « gens, c'est mon vrai setup de boulot en ce moment, j'en peux plus ». Pas de prompt engineering. Pas de « rendu Unreal Engine ». Juste un téléphone légèrement incliné parce qu'elle le tenait d'une main pendant qu'elle remuait son café.

Ce n'est pas un écart de qualité. C'est un écart de crédibilité, et il a un nom : l'heuristique du cerveau, « cette photo a-t-elle été prise par une personne dans une situation comme la mienne ? ». C'est la variable la plus ignorée dans les prompts d'images IA pour les réseaux sociaux.

## Le fil a déjà réglé la caméra

Quand quelqu'un scrolle des Reels Instagram, Xiaohongshu, TikTok ou un fil Twitter/X, il ne regarde pas un mur de galerie. Il regarde un rectangle d'environ 9:16 sur un téléphone, en plein jour, sous un néon de bureau ou la lueur bleue de son propre écran à 23 h. La « caméra attendue » dans ce contexte, c'est un objectif frontal à quelques centimètres d'un visage, ou un capteur arrière à bout de bras, légèrement décalé, sans équipe lumière.

Votre image n'a pas besoin d'être belle. Elle a besoin d'être *cohérente avec les conditions de prise de vue qu'implique le contexte dans lequel elle apparaît.* Un portrait 8K parfaitement éclairé épinglé à côté d'une photo au téléphone fait « pub ». Le réflexe anti-pub se déclenche avant que le pouce ait fini son mouvement. Ce n'est pas une question de goût ; c'est une reconnaissance de schéma qui opère en moins de 200 millisecondes.

La question opérante pour un prompt d'image IA n'est donc pas « quelle caméra produirait le plus beau résultat ? ». C'est « quelle caméra la personne dans cette image tiendrait-elle le plus plausiblement, maintenant, à l'endroit où elle est assise, en postant sur cette plateforme ? » La réponse dicte la distorsion, la focale, le modèle d'éclairage, l'erreur de cadrage. Tout.

## Les indices qui disent « un humain était là »

Passez une photo dans n'importe quel modèle vision-language et demandez-lui de lister les signes d'authenticité. Vous obtiendrez un vocabulaire que la plupart des prompteurs traitent comme des mots à *éviter*, inversés en mots à *inclure* :

- **Distorsion optique.** Les caméras frontales produisent un étalement grand angle autour du centre du visage, avec les bords qui cintreraient. Un « équivalent 24 mm » ou même « distorsion selfie grand angle » dans un prompt fait quelque chose qu'aucun « photoréaliste » ne fera jamais : ancrer l'image dans un dispositif optique précis et bon marché.
- **Une lumière franche et plate.** L'éclairage au néon au-dessus d'un bureau, la lumière d'une fenêtre avec une ombre visible d'une seule direction et aucun réflecteur, le bleu mat d'un écran de portable sur un visage le soir. Ce sont les conditions lumineuses des pièces réelles. Les boîtes à lumière de studio sont les conditions lumineuses d'une fiche produit.
- **Erreurs de cadrage.** Le sujet n'est pas pile au centre. L'horizon est légèrement penché. Un doigt dépasse dans un coin. Le sujet est coupé au front parce qu'on ajustait l'angle. On peut prompter cela par « composition légèrement penchée, tête coupée, doigt visible en bas à gauche du cadre ».
- **Flou de mouvement et bruit.** Quelques pixels de traînée sur la main parce que l'obturateur était lent. Du grain de capteur visible à haute sensibilité ISO. Pas « esthétique grain de pellicule » — le bruit chroma spécifique, en blocs, d'un capteur de téléphone qui pousse au-delà de sa plage en basse lumière.
- **Bazar contextuel.** Du linge sur une chaise. Un câble de recharge qui serpente sur le bureau. Un plat à moitié fini. Ce ne sont pas des accessoires ; ce sont les raisons pour lesquelles le cerveau classe l'image sous « le mardi de quelqu'un » plutôt que sous « le portfolio de quelqu'un ».

Aucun de ces éléments ne vous oblige à abandonner une intention esthétique. Un fond désordonné peut être *composé* comme désordonné. L'inclinaison peut être une *inclinaison choisie*. Mais le prompt doit s'engager sur la condition, pas sur le poli.

## Trois prompts, même sujet, trois lectures

Voici trois squelettes de prompt pour la même scène : une femme d'une vingtaine de fin d'année, cheveux courts et bruns, assise à un bureau encombré avec un ordinateur portable. Adaptez les détails du sujet à votre propre image persona. La logique structurelle se transpose directement sur Midjourney, DALL-E 3, Stable Diffusion XL ou tout modèle qui lit des prompts en langage naturel.

**Prompt A — celui qui fait un flop :**
`professional portrait photograph, woman late 20s short dark hair, sitting at desk with laptop, 85mm lens, f/1.4 bokeh, cinematic golden hour lighting, studio softbox key light, skin detail, 8K resolution, shot by Annie Leibovitz, magazine editorial, masterpiece`

Ça produit une image magnifique. Ça produit aussi une image qui, placée dans un fil entre une photo au téléphone et un Reel, fait « placement de marque ». L'engagement s'effondre non pas parce que l'image est mauvaise, mais parce que la caméra qu'elle affiche est un mensonge dans ce contexte.

**Prompt B — le demi-tour :**
`candid photo of a woman in her late twenties, short dark hair, working at a cluttered desk, laptop open, natural window light from the left, slight warm color cast, 35mm lens, shallow but present background blur, casual t-shirt, a half-eaten bowl of noodles beside her keyboard, shot on a mirrorless camera, unposed, slight film grain, muted tones`

Mieux. La source lumineuse est désormais unique et directionnellement crédible. Les « unposed » et « muted tones » tirent la palette vers le vécu. Mais « mirrorless camera » implique encore un boîtier dédié que quelqu'un a choisi de trimballer, et le cadrage 35 mm est trop propre pour un cliché de bureau.

**Prompt C — celui qui arrête le pouce :**
`front camera selfie taken while sitting at a messy desk, woman late 20s short dark hair slightly off to the left of frame, laptop screen casting blue light on one side of her face, overhead kitchen fluorescent adding a greenish flat fill on the other, a charging cable and crumpled receipts visible, phone angle slightly tilted 4 degrees, wide-angle lens distortion around the nose, sensor noise in the shadows, one hand partially visible at the bottom edge, background is a white wall with a single thumbtack and a sticky note, natural skin texture with no retouching, slightly out of focus on the background, iPhone front camera photo, 2025`

Ce n'est pas un prompt qui demande au modèle d'être un artiste. Il demande au modèle d'être un téléphone. Et dans un fil, c'est exactement ce que les gens s'attendent à voir.

## Commencer par la miniature, puis remonter jusqu'à la caméra

Voici le workflow que j'utilise, et j'aurais aimé que quelqu'un me le donne il y a un an et deux cents heures de prompts « masterpiece » :

1. **Nommer l'emplacement.** Image de couverture pour un post de 4 000 caractères sur Xiaohongshu ? Cadre de Story Instagram ? Illustration d'un quote-post Twitter/X ? La plateforme présélectionne le rectangle de vision et, surtout, la *caméra attendue*. Les Stories sont au téléphone. Les images d'une grille de feed sont plus tolérantes. Un hero d'article de blog peut se permettre un cran de polissage en plus.
2. **Nommer la posture du lecteur.** Est-ce qu'ils sont dans un RER, le pouce sur un écran fissuré, ou devant un moniteur de bureau pendant une pause café ? Un contexte « écran fissuré, scroll à une main » exige l'écart maximal entre « image produite » et « image vécue ». Un hero de blog sur un écran de 27 pouces vous laisse la marge pour un cadrage un peu plus composé.
3. **Nommer la caméra comme contrainte, puis la traduire en tokens de prompt.** « Caméra frontale iPhone, à bout de bras, néon de cuisine, légère distorsion grand angle, coupé au front » n'est pas une limitation. C'est un cahier des charges. Écrivez le cahier des charges dans le prompt avant d'écrire la description du sujet. Le sujet et le décor viennent *à l'intérieur* du cadre de la caméra, pas l'inverse.
4. **Retirer chaque mot qui signale la « production ».** « Cinematic », « masterpiece », « editorial », « studio », « bokeh », « 8K », « award-winning », tout nom de photographe. Ce sont les tokens qui poussent le résultat hors de la distribution « photo au téléphone » et dans la distribution « banque d'images ». Si vous voulez de la texture, dites « bruit de capteur à 1600 ISO », pas « esthétique grain de pellicule ».

## FAQ

**Est-ce que je peux quand même obtenir un résultat « esthétique » sans que tout ait l'air faux ?**
Oui, mais l'esthétique doit être celle du *téléphone*, pas celle d'un étalonneur. La dominante verdâtre du néon, la lueur bleue de l'écran sur la peau, les blancs légèrement délavés d'une cuisine — ce sont des palettes. Promptez-les directement (« mix de températures de couleur, vert chaud au plafond et bleu froid de l'écran »). Le résultat est visuellement plus intéressant qu'un énième grading cinématographique teal-and-orange.

**Est-ce que ça fonctionne pour les hero d'un blog ou d'un pitch deck ?**
Partiellement. Un hero de blog a une plus grande tolérance au poli parce que le contexte de vision (une page de lecture choisie) prédispose le lecteur à accepter une image travaillée. Un pitch deck est encore plus permissif. La stratégie du look amateur est spécifiquement pour les *contextes de fil*, où l'image apparaît parmi mille voisins capturés au téléphone. Pour une landing page autonome ou un portfolio, les règles s'assouplissent.

**Et si j'ai besoin d'un visage clairement « moi » pour une persona, mais que la distorsion frontale déforme mes traits ?**
La distorsion est le point. Un objectif frontal fait paraître votre nez plus large et votre front plus étroit. Vos abonnés associent déjà votre visage à *cette* géométrie, parce que c'est comme ça que vous vous voyez dans vos selfies. Un prompt qui lisse ces traits en géométrie « caméra beauté » produit un visage que le détecteur de patterns de votre audience signale comme autre. Vous pouvez réduire la distorsion avec un descripteur « équivalent 50 mm », mais n'éliminez pas complètement le léger étalement du nez.

**J'ai tenté le style Prompt C et le modèle m'a donné une image littéralement moche, surbruitée. Comment garder le « vrai » sans avoir l'air catastrophique ?**
Vrai ≠ moche. Le bruit d'une photo au téléphone est un bruit chroma de faible amplitude dans les ombres, pas une brume grise sur tout le cadre. Précisez *où* le bruit vit : « bruit de luminance dans les zones d'ombre uniquement, hautes lumières propres ». Précisez *où* l'inclinaison vit : « léger tilt, le visage du sujet reste bien dans le cadre ». L'objectif est un ou deux « défauts », pas une dégradation complète. Un horizon penché plus un fond bazar plus un câble de recharge, c'est déjà trois signaux d'authenticité. Vous n'avez pas besoin d'en plus flouter le sujet.

---

La prochaine fois que vous ouvrirez une fenêtre de prompt pour une image de couverture, la première phrase que vous taperez ne devrait pas décrire votre sujet. Elle devrait décrire le téléphone dans la main du sujet, la lumière au-dessus de lui, et la raison pour laquelle le cadre est de travers. Tout le reste rentre dans ces contraintes. Le ressenti « amateur » n'est pas un compromis. Dans un fil, c'est la seule langue que le pouce de votre audience parle couramment.