Você postou uma imagem de lifestyle na terça-feira. “Hora dourada, shot on Canon R5, 85mm f/1.4, color grading cinematográfico, masterpiece, 8K.” Rosto bonito, pele impecável, aquela luz de contorno suave que todo mundo ama. Três curtidas. Sua amiga postou uma foto embaçada, vista de cima da mesa dela, com uma suculenta moribunda num canto e o rabo do gato atravessando o quadro. Dezessete salvamentos. Você foi na legenda: “gente, esse é o meu setup real de trabalho agora, tô morrendo.” Sem engenharia de prompt. Sem “unreal engine render”. Só um celular inclinado uns poucos graus porque ela estava com uma mão e mexendo o café com a outra.
Isso não é um gap de qualidade. É um gap de credibilidade, e ele tem nome: a heurística do cérebro — “isso foi tirado por alguém numa situação parecida com a minha?” — que é a variável mais ignorada em toda prompt de imagem de IA para conteúdo social.
O feed já definiu a câmera
Quando alguém rola o Instagram Reels, o Xiaohongshu, o TikTok ou a timeline do Twitter/X, não está olhando para a parede de uma galeria. Está olhando para um retângulo de proporção 9:16 na tela de um celular, sob luz do sol, fluorescente de teto ou o brilho azulado da própria tela às onze da noite. A “câmera esperada” nesse contexto é uma frontal a uns palmos do rosto, ou uma traseira na extensão do braço, ligeiramente fora do eixo, sem equipe de iluminação.
Sua imagem não precisa ser bonita. Ela precisa ser coerente com as condições de captura que o contexto em que aparece implica. Um retrato 8K perfeitamente iluminado, pinado ao lado de uma foto de celular, é lido como anúncio. O freio automático de “isso é propaganda” aciona antes que o dedo termine o swipe. Não é questão de gosto; é reconhecimento de padrões que acontece em menos de 200 milissegundos.
Então a pergunta operatória para um prompt de imagem de IA não é “qual câmera produziria o melhor resultado?” É “qual câmera a pessoa nesta imagem estaria plausivelmente segurando, neste exato momento, no lugar onde está sentada, postando nesta plataforma?” Essa resposta dita a distorção, a distância focal, o modelo de iluminação, o desalinhamento do enquadramento. Tudo.
As pistas que dizem “um humano estava aqui”
Passe uma foto por qualquer modelo vision-language e peça que liste os sinais de autenticidade. Você vai receber um vocabulário que a maioria das pessoas que escreve prompts trata como palavras a evitar, invertido em palavras a incluir:
- Distorção de lente. Câmeras frontais produzem uma abertura grande-angular em torno do centro do rosto, com as bordas curvando. Um “24mm equivalente” ou “wide-angle selfie distortion” num prompt faz o que nenhum volume de “photorealistic” faz: ancora a imagem num dispositivo óptico específico e barato.
- Luz dura e sem graça. Fluorescente de teto sobre uma mesa, luz de janela com sombra visível em uma só direção e sem preenchimento, o azul plano de uma tela de notebook batendo num rosto à noite. Essas são as condições de iluminação de cômodos reais. Softbox de estúdio são as condições de iluminação de uma página de produto.
- Erros de enquadramento. O assunto não está no centro exato. O horizonte está levemente torto. Um dedo invade o canto. O sujeito está cortado na testa porque estava ajustando o ângulo. Dá para pedir isso com “slightly tilted composition, cropped head, finger edge visible in lower-left frame”.
- Movimento e ruído. Alguns pixels de borrão na mão porque o obturador era lento. Grão de sensor visível em ISO alto. Não “film grain aesthetic” — o ruído crominância granulado específico de um sensor de celular estourando o orçamento na pouca luz.
- Bagunça contextual. Roupa na cadeira. Um cabo de carregador serpenteando pela mesa. Comida inacabada. Isso não são adereços; são a razão pela qual o cérebro arquiva a imagem em “terça-feira de alguém” em vez de “portfólio de alguém”.
Nada disso exige que você abandone a intenção estética. Um fundo bagunçado pode ser composto para estar bagunçado. A inclinação pode ser uma inclinação escolhida. Mas o prompt precisa se comprometer com a condição, não com o polimento.
Três prompts, mesmo assunto, três leituras
Abaixo estão três esqueletos de prompt para a mesma cena: uma mulher no fim dos vinte anos, cabelo escuro curto, sentada numa mesa bagunçada com um notebook. Adapte os detalhes do assunto à sua própria imagem de persona. A lógica estrutural se transfere diretamente para Midjourney, DALL-E 3, Stable Diffusion XL ou qualquer modelo que leia prompts em linguagem natural.
Prompt A — o que afunda:
professional portrait photograph, woman late 20s short dark hair, sitting at desk with laptop, 85mm lens, f/1.4 bokeh, cinematic golden hour lighting, studio softbox key light, skin detail, 8K resolution, shot by Annie Leibovitz, magazine editorial, masterpiece
Produz uma imagem linda. Também produz uma imagem que, colocada num feed entre uma foto de celular e um Reel, é lida como “parceria com marca”. O engajamento despenca não porque a imagem é ruim, mas porque a câmera que ela declara é uma mentira nesse contexto.
Prompt B — o meio-termo:
candid photo of a woman in her late twenties, short dark hair, working at a cluttered desk, laptop open, natural window light from the left, slight warm color cast, 35mm lens, shallow but present background blur, casual t-shirt, a half-eaten bowl of noodles beside her keyboard, shot on a mirrorless camera, unposed, slight film grain, muted tones
Melhor. A fonte de luz agora é única e directionalmente crível. O “unposed” e os “muted tones” puxam a paleta para o vivido. Mas “mirrorless camera” ainda implica um corpo dedicado que alguém escolheu carregar, e o enquadramento de 35mm é organizado demais para um snapshot de mesa.
Prompt C — o que trava o dedo:
front camera selfie taken while sitting at a messy desk, woman late 20s short dark hair slightly off to the left of frame, laptop screen casting blue light on one side of her face, overhead kitchen fluorescent adding a greenish flat fill on the other, a charging cable and crumpled receipts visible, phone angle slightly tilted 4 degrees, wide-angle lens distortion around the nose, sensor noise in the shadows, one hand partially visible at the bottom edge, background is a white wall with a single thumbtack and a sticky note, natural skin texture with no retouching, slightly out of focus on the background, iPhone front camera photo, 2025
Este não é um prompt que pede ao modelo que seja artista. Pede que seja um celular. E num feed, é exatamente isso que as pessoas esperam ver.
Comece pela miniatura, depois reverse-engineer a câmera
Aqui está o workflow que eu uso, e como eu gostaria que alguém tivesse me entregado isso há um ano e duzentas horas de prompts com “masterpiece”:
- Nomeie a colocação. Imagem de capa de um post de 4000 caracteres no Xiaohongshu? Frame de Instagram Story? Ilustração de um quote-post no Twitter/X? A plataforma pré-seleciona o retângulo de visualização e, criticamente, a câmera esperada. Stories são capturados por celular. Imagens do grid do feed são mais permissivas. Uma imagem principal de blog pode levar um grau a mais de polimento.
- Nomeie a postura do espectador. Está num trem olhando uma tela rachada com uma mão, ou num monitor de mesa durante um intervalo de café? Um contexto de tela-rachada-scroll-de-uma-mão exige o maior gap possível entre “imagem produzida” e “imagem vivida”. Uma imagem principal de blog num display de 27 polegadas te dá margem para um enquadramento ligeiramente mais composto.
- Nomeie a câmera como restrição, depois traduza em tokens do prompt. “iPhone front camera, arm’s length, kitchen overhead fluorescent, slight wide-angle distortion, cropped at forehead” não é uma limitação. É um brief de design. Escreva o brief no prompt antes de escrever a descrição do assunto. Sujeito e cenário entram dentro do quadro da câmera, não o contrário.
- Descarte toda palavra que sinalize “produção”. “Cinematic”, “masterpiece”, “editorial”, “studio”, “bokeh”, “8K”, “award-winning”, qualquer nome de fotógrafo. Esses são os tokens que empurram o output da distribuição de foto de celular para a distribuição de banco de imagens. Se quiser textura, escreva “sensor noise at ISO 1600”, não “film grain aesthetic”.
FAQ
Dá para ter um resultado “estético” sem que tudo pareça falso? Dá, mas a estética tem que ser a do celular, não a de um colorista. O tom esverdeado da fluorescente, o brilho azul da tela na pele, os brancos levemente lavados de uma cozinha — esses são paletas. Peça por elas diretamente (“mixed color temperature, warm overhead green and cool screen blue”). O resultado é visualmente mais interessante que mais um grade teal-and-orange de cinema.
Isso funciona para imagens principais de blog ou pitch deck? Em parte. Uma imagem principal de blog tem uma tolerância maior para polimento porque o contexto de visualização (uma página de leitura deliberada) predispõe o leitor a aceitar uma imagem produzida. Um pitch deck é ainda mais permissivo. A estratégia do look amador é especificamente para contextos de feed, onde a imagem aparece ao lado de mil vizinhas capturadas por celular. Para uma landing page isolada ou um portfólio, as regras se afrouxam.
E se eu preciso de um rosto que seja claramente “o meu” para uma persona, mas a distorção da câmera frontal faz meus traços parecerem errados? A distorção é o ponto. Uma câmera frontal faz o nariz parecer maior e a testa parecer mais estreita. Seus seguidores já associam seu rosto à aquela geometria porque é assim que você aparece nos seus selfies. Um prompt que suaviza esses traços para a geometria do “modo beleza” produz um rosto que o pattern-matcher da audiência identifica como “de outra pessoa”. Dá para reduzir a distorção com um descritor de “50mm equivalente”, mas não elimine totalmente o leve alargamento do nariz.
Tentei o estilo do Prompt C e o modelo me deu uma imagem literalmente feia, com ruído demais. Como manter “real” e ainda parecer decente? Real ≠ feio. O ruído numa foto de celular é um ruído crominância de baixo nível nas sombras, não uma névoa cinza sobre o quadro inteiro. Especifique onde o ruído mora: “luminance noise in shadow areas only, clean highlights”. Especifique onde a inclinação mora: “slight tilt, subject’s face still well within frame”. O objetivo é um ou dois “defeitos”, não uma degradação completa. Um horizonte torto mais um fundo bagunçado mais um cabo de carregador já são três sinais de autenticidade. Você não precisa ainda por cima borrar o sujeito.
Da próxima vez que abrir uma janela de prompt para uma imagem de capa, a primeira frase que você digitar não deve descrever seu assunto. Deve descrever o celular na mão do assunto, a luz acima dele e o motivo de o quadro não estar reto. Todo o resto se encaixa dentro dessas restrições. O “amador” não é um concessão. Num feed, é a única língua que o público fala com fluidez.