Tu prompt dice «obra maestra». Tu audiencia ve un montaje.

Publicaste una imagen lifestyle el martes pasado. «Hora dorada, fotografiado con Canon R5, 85mm f/1.4, color grading cinematográfico, obra maestra, 8K.» Cara bonita, piel perfecta, esa luz de contorno suave que a todos les encanta. Tres likes. Tu amiga subió una foto borrosa, tomada desde arriba, de su escritorio con una suculenta medio muerta en un rincón y la cola de su gato atravesando el cuadro. Diecisiete guardados. Revisaste su caption: «chicos esto es mi setup real de trabajo ahorita me muero». Sin ingeniería de prompts. Sin «render de Unreal Engine». Solo un teléfono inclinado unos grados porque lo sostenía mientras removía el café.

Esto no es una brecha de calidad. Es una brecha de credibilidad, y tiene nombre: el heurístico del cerebro de «¿esto lo tomó una persona en una situación como la mía?». Y es la variable más ignorada en los prompts de imágenes con IA para contenido social.

El feed ya definió la cámara

Cuando alguien hace scroll en Instagram Reels, Xiaohongshu, TikTok o un timeline de Twitter/X, no está mirando la pared de una galería. Está mirando un rectángulo de proporción aproximada 9:16 en un teléfono, bajo luz natural, fluorescente de techo o el resplandor azul de su propia pantalla a las once de la noche. La «cámara esperada» en ese contexto es una lente frontal a pocos centímetros de una cara, o una cámara trasera a la distancia del brazo, ligeramente fuera de eje, sin equipo de iluminación.

Tu imagen no necesita ser hermosa. Necesita ser consistente con las condiciones de captura que el contexto donde aparece implica. Un retrato perfectamente iluminado en 8K junto a una foto de teléfono se lee como publicidad. El «freno de ad» se activa antes de que el pulgar termine su deslizamiento. No es una cuestión de gusto; es pattern-matching que ocurre en menos de 200 milisegundos.

Así que la pregunta operativa para un prompt de imagen con IA no es «¿qué cámara produciría el resultado más bonito?». Es «¿qué cámara sostendría plausiblemente la persona de esta imagen, en este momento, en el lugar donde está sentada, publicando en esta plataforma?». Esa respuesta dicta la distorsión, la distancia focal, el modelo de iluminación, el error de encuadre. Todo.

Las pistas que dicen «aquí hubo un humano»

Pasa una foto por cualquier modelo visión-lenguaje y pídele que enumere las señales de autenticidad. Obtendrás un vocabulario que la mayoría de quienes escriben prompts trata como palabras a evitar, invertido en palabras a incluir:

  • Distorsión de lente. Las cámaras frontales producen un estiramiento angular amplio alrededor del centro del rostro, con los bordes combados. Un «equivalente de 24mm» o incluso «distorsión de selfie gran angular» en un prompt hace algo que ningún «fotorrealista» logra: anclar la imagen en un dispositivo óptico específico y barato.
  • Luz dura y aburrida. El tubo fluorescente de techo sobre un escritorio, la luz de ventana con sombra direccional visible sin relleno, el azul plano de una pantalla de laptop sobre una cara de noche. Estas son las condiciones de iluminación de habitaciones reales. Los softboxes de estudio son las condiciones de iluminación de una página de producto.
  • Errores de encuadre. El sujeto no está perfectamente centrado. El horizonte está ligeramente inclinado. Un dedo invade la esquina. El rostro aparece cortado por la frente porque alguien estaba ajustando el ángulo. Puedes escribir esto en el prompt: «composición ligeramente inclinada, cabeza cortada, borde de dedo visible en la esquina inferior izquierda».
  • Movimiento y ruido. Unos píxeles de barrido en la mano porque el obturador era lento. Grano de sensor visible a alto ISO. No «estética de grano de película» — el ruido de croma grumoso específico de un sensor de teléfono que supera su presupuesto en poca luz.
  • Desorden contextual. Ropa tendida en una silla. Un cable de carga serpenteando por el escritorio. Comida a medio terminar. Estos no son atrezzo; son la razón por la que el cerebro archiva la imagen bajo «martes de alguien» en lugar de «portafolio de alguien».

Nada de esto exige que abandones la intención estética. Un fondo desordenado puede estar compuesto en su desorden. La inclinación puede ser una inclinación elegida. Pero el prompt debe comprometerse con la condición, no con el pulido.

Tres prompts, mismo sujeto, tres lecturas

A continuación hay tres esqueletos de prompt para la misma escena: una mujer de veintitantos, pelo oscuro corto, sentada en un escritorio desordenado con una laptop. Adapta los detalles del sujeto a tu propia imagen de persona pública. La lógica estructural se transfiere directamente a Midjourney, DALL-E 3, Stable Diffusion XL o cualquier modelo que lea prompts en lenguaje natural.

Prompt A — el que no funciona: professional portrait photograph, woman late 20s short dark hair, sitting at desk with laptop, 85mm lens, f/1.4 bokeh, cinematic golden hour lighting, studio softbox key light, skin detail, 8K resolution, shot by Annie Leibovitz, magazine editorial, masterpiece

Esto produce una imagen preciosa. También produce una imagen que, colocada en un feed entre una foto de teléfono y un Reel, se lee como «colaboración de marca». El engagement se hunde no porque la imagen sea mala, sino porque la cámara que declara es una mentira en este contexto.

Prompt B — el paso intermedio: candid photo of a woman in her late twenties, short dark hair, working at a cluttered desk, laptop open, natural window light from the left, slight warm color cast, 35mm lens, shallow but present background blur, casual t-shirt, a half-eaten bowl of noodles beside her keyboard, shot on a mirrorless camera, unposed, slight film grain, muted tones

Mejor. La fuente de luz ahora es singular y direccionalmente real. El «sin posar» y los «tonos apagados» empujan la paleta hacia lo vivido. Pero «cámara mirrorless» todavía implica un cuerpo dedicado que alguien eligió cargar, y el encuadre de 35mm es demasiado pulcro para una foto de escritorio.

Prompt C — el que frena el pulgar: front camera selfie taken while sitting at a messy desk, woman late 20s short dark hair slightly off to the left of frame, laptop screen casting blue light on one side of her face, overhead kitchen fluorescent adding a greenish flat fill on the other, a charging cable and crumpled receipts visible, phone angle slightly tilted 4 degrees, wide-angle lens distortion around the nose, sensor noise in the shadows, one hand partially visible at the bottom edge, background is a white wall with a single thumbtack and a sticky note, natural skin texture with no retouching, slightly out of focus on the background, iPhone front camera photo, 2025

Esto no es un prompt que le pida al modelo ser un artista. Le pide al modelo ser un teléfono. Y en un feed, eso es exactamente lo que la gente espera ver.

Empieza por la miniatura, luego reinvéntate la cámara

Este es el flujo de trabajo que uso, y ojalá alguien me lo hubiera entregado un año y doscientas horas de prompts con «obra maestra» antes:

  1. Nombra la ubicación. ¿Imagen de portada para un post de 4000 caracteres en Xiaohongshu? ¿Frame de Instagram Stories? ¿Ilustración de un quote-post en Twitter/X? La plataforma pre-selecciona el rectángulo de visualización y, crucialmente, la cámara esperada. Las Stories se toman con el teléfono. Las imágenes del feed son más indulgentes. Una imagen hero de blog puede permitirse un punto más de pulido.
  2. Nombra la postura del espectador. ¿Están en un tren de cercanías mirando una pantalla agrietada con una mano, o en un monitor de escritorio durante un descanso para el café? Un contexto de pantalla agrietada y scroll con una mano exige la mayor distancia posible entre «imagen producida» e «imagen vivida». Una imagen hero de blog en un monitor de 27 pulgadas te da margen para un poco más de composición.
  3. Nombra la cámara como restricción, luego tradúcela a tokens del prompt. «Cámara frontal de iPhone, distancia del brazo, fluorescente de cocina en el techo, ligera distorsión gran angular, cortado por la frente» no es una limitación. Es un brief de diseño. Escribe el brief en el prompt antes de escribir la descripción del sujeto. El sujeto y el entorno van dentro del marco de la cámara, no al revés.
  4. Elimina toda palabra que señale «producción». «Cinematográfico», «obra maestra», «editorial», «estudio», «bokeh», «8K», «premiado», cualquier nombre de fotógrafo. Estos son los tokens que empujan la salida fuera de la distribución de foto de teléfono y dentro de la distribución de banco de imágenes. Si quieres textura, escribe «ruido de sensor a ISO 1600», no «estética de grano de película».

FAQ

¿Puedo seguir obteniendo un resultado «estético» sin que todo parezca falso? Sí, pero la estética tiene que ser la del teléfono, no la de un colorista. El tinte verdoso del fluorescente, el resplandor azul de la laptop sobre la piel, los blancos ligeramente lavados en una cocina — eso son paletas. Pídelas directamente («temperatura de color mixta, verde cálido cenital y azul frío de pantalla»). El resultado es visualmente más interesante que otro teal-and-orange cinematográfico.

¿Esto funciona para imágenes hero en un blog o un pitch deck? En parte. Una imagen hero de blog tiene mayor tolerancia al pulido porque el contexto de visualización (una página de lectura deliberada) predispone al lector a aceptar una imagen producida. Un pitch deck es aún más indulgente. La estrategia de look amateur es específicamente para contextos de feed, donde la imagen aparece junto a mil vecinas capturadas con teléfono. Para una landing page o un portafolio aislados, las reglas se relajan.

¿Y si necesito una cara que sea claramente «yo» para una persona pública, pero la distorsión de cámara frontal me hace ver raro? La distorsión es el punto. Una cámara frontal agranda la nariz y estrecha la frente. Tus seguidores ya asocian tu cara con esa geometría porque así te ven en tus selfies. Un prompt que suaviza esos rasgos hacia la geometría de «belleza de cámara» produce una cara que el pattern-matcher de tu audiencia marca como ajena. Puedes reducir la distorsión con un descriptor «equivalente de 50mm», pero no elimines del todo el ligero estiramiento del ancho de nariz.

Probé el estilo del Prompt C y el modelo me dio una imagen literalmente fea, con ruido excesivo. ¿Cómo mantengo lo «real» sin que parezca horrible? Real ≠ feo. El ruido en una foto de teléfono es ruido de croma de bajo nivel en las sombras, no una niebla gris sobre todo el fotograma. Especifica dónde vive el ruido: «ruido de luminancia solo en áreas de sombra, luces limpias». Especifica dónde vive la inclinación: «ligera inclinación, el rostro del sujeto sigue bien dentro del encuadre». El objetivo es uno o dos «defectos», no una degradación total. Un horizonte inclinado más un fondo desordenado más un cable de carga ya son tres señales de autenticidad. No necesitas además desenfocar al sujeto.


La próxima vez que abras una ventana de prompt para una imagen de portada, la primera frase que escribas no debe describir a tu sujeto. Debe describir el teléfono en la mano del sujeto, la luz sobre él y la razón por la que el encuadre no está recto. Todo lo demás cabe dentro de esas restricciones. Lo «amateur» no es un compromiso. En un feed, es el único idioma que el pulgar de tu audiencia habla con fluidez.