Imagem para prompt JSON: fluxo editável e verificável
Um processo independente de modelo para extrair apenas evidências visíveis, separar o que deve ficar do que pode mudar, gerar opções e aprovar o resultado com critérios claros.
Conteúdo

Um prompt JSON criado a partir de uma imagem funciona melhor como uma especificação visual editável. Ele não recupera o “prompt secreto” que originou a imagem. O fluxo prático é: registrar apenas o que está visível, separar o que precisa permanecer do que será alterado, gerar várias opções e comparar cada uma com a referência usando a mesma ficha de avaliação.
O JSON ajuda a separar assunto, composição, iluminação, cores, materiais e texto. Mas os pixels não revelam o modelo exato da câmera, a tecnologia de uma luz fora do enquadramento, o nome preciso da fonte, a seed nem as palavras usadas pelo criador. O objetivo é uma semelhança controlável e testável, não uma cópia pixel a pixel.
A seguir você encontra um metaprompt pronto, uma estrutura JSON, um método de edição e critérios de aceitação.
O que este fluxo resolve
Use-o para:
- preservar a lógica visual de uma referência e trocar apenas elementos escolhidos;
- reutilizar a mesma especificação em modelos diferentes;
- entender por que a saída tem o estilo certo, mas a composição errada;
- revisar fotos, anúncios, pôsteres, interfaces e ilustrações de forma repetível.
Não chame o JSON de prompt original recuperado. A imagem final não contém todo o histórico de geração, referências ocultas, instruções ignoradas ou pós-produção.
Uma boa especificação precisa ser:
- Observável: toda afirmação tem apoio nos pixels.
- Editável: cada dimensão importante possui um campo separado.
- Verificável: cada campo corresponde a algo que pode ser conferido na saída.
O que preparar
Você precisa de:
- uma referência na melhor resolução que possa usar legalmente;
- um modelo capaz de analisar imagens;
- um gerador ou editor de imagens;
- um local para salvar JSON, versão do modelo, parâmetros e resultados;
- uma frase clara sobre o que deve ficar igual e o que pode mudar.
Recorte molduras do navegador, comentários e áreas que não façam parte do design. Preserve a proporção original, a menos que alterá-la seja parte explícita da tarefa.
A documentação oficial da OpenAI sobre imagens e visão e a do Google sobre compreensão de imagens mostram que sistemas multimodais atuais podem analisar entradas visuais. As ferramentas de geração também aceitam referências ou edição iterativa. Como o formato varia por fornecedor, o método abaixo é independente de modelo.
Etapa 1: extraia um JSON de observações
Envie a imagem junto com o prompt abaixo. Ele proíbe transformar inferências invisíveis em fatos.
Atue como analista de evidências visuais. Examine a imagem de referência
anexada e devolva apenas um objeto JSON válido.
Regras:
1. Descreva somente evidências diretamente visíveis.
2. Não deduza causas ocultas, o prompt original, câmera exata, datas,
tecnologia de iluminação invisível ou texto ilegível.
3. Use null quando um valor não puder ser determinado pela imagem.
4. Mantenha dimensões visuais diferentes em campos separados.
5. Transcreva exatamente o texto claramente legível; não adivinhe letras.
6. Explicite relações espaciais: esquerda/direita, acima/abaixo,
primeiro plano/fundo, centralizado/deslocado, tamanho e sobreposição.
7. Antes de responder, procure contradições entre os campos.
8. Use frases completas e concretas, não listas vagas de adjetivos.
Retorne esta estrutura:
{
"image_type": null,
"subject": null,
"action": null,
"location": null,
"composition": {
"orientation_and_aspect_ratio": null,
"framing_and_crop": null,
"subject_placement": null,
"spatial_relationships": null,
"negative_space": null
},
"lighting": {
"visible_direction": null,
"apparent_temperature": null,
"softness_and_contrast": null,
"highlights_reflections_shadows": null,
"unknown_causes": null
},
"color_palette": null,
"materials_and_textures": null,
"camera_and_focus": {
"viewpoint": null,
"perspective": null,
"depth_of_field": null,
"sharp_and_blurred_regions": null
},
"text_and_typography": {
"verbatim_text": [],
"placement_and_alignment": null,
"size_hierarchy": null,
"visible_lettering_style": null,
"unreadable_text": null
},
"style": null,
"mood_and_vibe": null,
"uncertainties": [],
"exclusions": null
}
Valide antes de gerar
Confira quatro pontos:
- o objeto é JSON válido, sem comentários, vírgulas finais ou explicações;
- os campos necessários estão presentes;
- o que não pode ser confirmado aparece como
nullou emuncertainties; - não existem contradições internas.
Os exemplos da prática de usuário que inspirou este guia mostram dois erros comuns. Na foto de um gato dentro de uma geladeira, é possível observar luz fria no interior e luz quente na cozinha, mas não provar que a lâmpada é LED. Em uma captura de site, a análise identifica corretamente o título alinhado à esquerda e, ao mesmo tempo, chama o hero de centralizado. O primeiro é uma inferência sem evidência; o segundo é uma contradição. Ambos devem bloquear a geração.
Etapa 2: separe fixo, editável e desconhecido
Classifique os dados antes de reescrever:
| Estado | Significado | Exemplo |
|---|---|---|
locked | deve ser preservado | posição, hierarquia, proporção |
editable | será alterado intencionalmente | cor, cenário, título |
unknown | não é demonstrado pela imagem | lente, tipo de luz, fonte exata |
Crie um objeto de controle ao lado do JSON:
{
"locked": [
"um assunto principal no terço inferior esquerdo",
"grande espaço negativo à direita",
"luz lateral suave e baixo contraste geral",
"título acima da linha de apoio"
],
"editable": {
"subject": "substituir a caneca de cerâmica por uma garrafa de vidro transparente",
"accent_color": "trocar vermelho discreto por azul-cobalto",
"verbatim_text": ["NORTH", "STILL WATER"]
},
"unknown": [
"modelo da câmera",
"distância focal exata",
"família tipográfica exata",
"tipo físico da luz fora do quadro"
],
"hard_constraints": [
"não adicionar outro texto",
"não alterar o ponto de vista",
"não incluir objetos fora do layout de referência"
]
}
Isso comunica três ações diferentes: preservar, alterar e não inventar.
Remova conflitos
Leia a especificação em linguagem comum:
- o assunto não pode estar centralizado e alinhado à esquerda ao mesmo tempo;
- o recorte deve combinar com a proporção declarada;
- luz suave não combina com sombras duras sem outra fonte visível;
- “sem texto” não pode coexistir com um título obrigatório;
- o mesmo objeto não pode ocupar duas posições incompatíveis.
O gerador não é obrigado a resolver essas contradições corretamente. Ele pode escolher uma opção, misturar as duas ou ignorá-las.
Etapa 3: gere um primeiro lote controlado
Entregue o JSON e o objeto de controle ao gerador. Anexe a referência quando a ferramenta aceitar image-to-image ou edição. Os guias oficiais da OpenAI e do Google documentam entradas visuais e edição iterativa, embora os recursos exatos dependam do modelo.
Use esta mensagem de passagem:
Crie uma nova imagem usando a referência anexada e a especificação JSON.
Prioridade:
1. Cumpra hard_constraints.
2. Preserve todos os itens de locked.
3. Aplique somente as mudanças de editable.
4. Trate unknown como desconhecido; não invente detalhes técnicos.
5. Iguale primeiro composição e relações espaciais, depois a textura.
6. O texto entre aspas deve aparecer exatamente uma vez, sem palavras extras.
7. Não copie marcas-d'água, assinaturas ou logotipos protegidos.
Retorne uma imagem e não explique o prompt.
Se a ferramenta ignorar JSON, transforme os mesmos dados em seções:
ASSUNTO:
COMPOSIÇÃO:
ILUMINAÇÃO:
COR:
MATERIAIS:
TEXTO:
ESTILO:
PRESERVAR:
ALTERAR:
NÃO ADICIONAR:
JSON é a fonte editável da especificação, não um protocolo universal para todos os geradores.
No primeiro lote:
- use a proporção da referência;
- registre a seed se existir, sem esperar portabilidade entre modelos;
- gere três ou quatro candidatos;
- salve JSON, referência, modelo e versão, configurações e saídas;
- nomeie as execuções como
v01-a,v01-bev01-c.
O sinal de sucesso é: ao menos um candidato passa por todos os critérios obrigatórios e não apresenta falha grave nos campos de maior prioridade.
Etapa 4: avalie contra a referência
Compare as imagens no mesmo tamanho. Dê:
0: errado ou ausente;1: parcialmente correto;2: adequado para o uso pretendido.
| Campo | O que comparar |
|---|---|
| Assunto | quantidade, traços, silhueta, tamanho relativo |
| Composição | posição, corte, equilíbrio, espaço negativo, sobreposição |
| Relações espaciais | esquerda/direita, acima/abaixo, frente/trás |
| Iluminação | direção, temperatura, suavidade, contraste, sombras |
| Cor | cores dominantes, secundárias e de destaque e suas áreas |
| Materiais | brilho, transparência, tecido, grão, pelo, metal, papel |
| Texto | conteúdo exato, quantidade, ortografia, alinhamento, hierarquia |
| Estilo e clima | meio, acabamento, tratamento, atmosfera |
Critérios obrigatórios:
- nenhuma afirmação invisível ou sem evidência;
- nenhuma contradição interna;
- texto obrigatório correto;
- relações espaciais críticas preservadas;
- nenhum objeto, texto, logotipo ou marca-d’água não solicitado.
A soma ajuda a ordenar resultados, mas não compensa um critério obrigatório reprovado. Uma imagem bonita com o slogan errado ou o layout invertido continua inadequada.
Revise do macro para o detalhe
Ordem:
- tela e composição;
- quantidade, posição e escala;
- luz e grandes blocos de cor;
- material e textura;
- tipografia e detalhes.
Não aperfeiçoe textura se o assunto estiver no lado errado.
Etapa 5: altere um grupo por vez
Escolha o melhor candidato como nova base. Corrija apenas o grupo relacionado ao maior erro.
| Problema | Alterar | Preservar explicitamente |
|---|---|---|
| Assunto grande demais | posição e escala em composition | ponto de vista, luz, paleta |
| Layout desviou | relações espaciais e espaço negativo | aparência e materiais |
| Cena quente demais | temperatura e paleta | geometria e texto |
| Produto parece plástico | material, brilho e reflexão | forma, posição, rótulo |
| Texto errado | texto literal, quantidade, posição | todo o resto se houver edição |
| Estilo certo, identidade errada | traços do assunto ou força da referência | composição e fundo |
Escreva: “Altere somente o título. Preserve enquadramento, ponto de vista, geometria, iluminação, cores e os demais textos”.
Os guias oficiais também recomendam separar alterações de restrições e refinar um elemento por vez. Assim cada rodada é diagnosticável.
Falhas comuns e recuperação
A saída não é JSON válido
Peça o reparo do objeto existente:
Converta o conteúdo abaixo em JSON válido. Preserve tudo o que é sustentado
pela imagem. Não acrescente novas afirmações visuais. Retorne somente JSON.
Schema ou structured output reduz erros de sintaxe, mas não comprova que a análise é verdadeira.
O gerador ignora os campos
Converta o objeto em seções de linguagem natural. Coloque PRESERVAR, ALTERAR e NÃO ADICIONAR no final e remova detalhes secundários que escondam as restrições principais.
A composição continua mudando
Adicione relações concretas:
- “o centro do assunto fica em cerca de 30% da largura”;
- “a borda esquerda do título segue a mesma guia da imagem”;
- “o produto ocupa o terço inferior”;
- “a metade direita permanece quase vazia”.
Coordenadas orientam, mas não garantem. Inspecione o resultado.
O texto exato falha
Coloque a frase entre aspas, determine quantas vezes deve aparecer, onde ficará e proíba palavras extras. Siga um fluxo text-first se o provedor recomendar. Quando a exatidão for obrigatória, planeje finalizar a tipografia em uma ferramenta de design. A documentação atual da OpenAI reconhece limitações de posicionamento e clareza de texto; a do Google também recomenda gerar o texto primeiro para imagens com lettering.
Personagem ou produto muda entre versões
Use a melhor saída anterior como imagem de edição, em vez de começar novamente. Repita um bloco curto de identidade, geometria e rótulos. Compare múltiplas execuções, pois a consistência de personagens, marcas e layouts precisos ainda pode variar.
A solicitação falha antes da imagem
Registre o erro e o request ID. Corrija autenticação, quota, entrada ou moderação antes de repetir. Use backoff apenas para rate limit temporário ou erro de servidor; mude primeiro solicitações corrigíveis pelo usuário.
Salve um registro de aceitação
{
"run_id": "v03-b",
"reference_file": "reference.png",
"analysis_json": "reference.v01.json",
"generator_and_version": "registrar-o-valor-real",
"settings": {
"aspect_ratio": "registrar-o-valor-real",
"quality": "registrar-o-valor-real",
"seed": null
},
"scores": {
"subject": 2,
"composition": 2,
"spatial_relations": 2,
"lighting": 1,
"color": 2,
"materials": 1,
"text": 2,
"style_and_mood": 2
},
"hard_gates": {
"unsupported_claims": false,
"contradictions": false,
"required_text_wrong": false,
"critical_layout_wrong": false,
"unrequested_elements": false
},
"decision": "accept",
"next_change": null
}
Isso transforma “prefiro a versão B” em uma decisão auditável e mostra se trocar de modelo melhorou a qualidade ou apenas mudou o estilo.
Perguntas frequentes
É possível recuperar o prompt original exato?
Não. É possível criar uma descrição útil das evidências visíveis. O processo original pode ter usado referências ocultas, seeds, configurações, instruções descartadas, múltiplas edições e pós-produção.
O que escrever sobre câmera e luz?
Descreva efeitos visíveis: ponto de vista, perspectiva, profundidade de campo, suavidade das sombras, direção aparente e temperatura. Não afirme equipamento exato nem tecnologia invisível sem outra fonte verificada.
Todo gerador aceita JSON?
Não. Mantenha JSON como especificação principal e converta-o para o formato que a ferramenta escolhida segue melhor.
Quantas iterações devo fazer?
Comece com três ou quatro candidatos, escolha a base mais forte e altere um grupo por rodada. Pare quando todos os critérios obrigatórios passarem e novas mudanças não melhorarem o uso real.
Uma alta semelhança geral é suficiente?
Não. Ela pode esconder texto errado, layout invertido, objeto extra ou logotipo inventado. A revisão por campo continua necessária.
Fontes e nível de evidência
- Thread de Vox no X: prática relatada por usuário que motivou a separação em campos; não é benchmark independente.
- OpenAI: imagens e visão, geração e prompting de imagens: documentação oficial sobre entradas visuais, edição, estrutura, avaliação e limitações.
- Google: compreensão de imagens e geração: documentação oficial sobre análise, JSON estruturado, referências, iteração e limites.
O ponto central independe do fornecedor: mantenha evidências observáveis em uma estrutura, declare as alterações com clareza e aceite a saída comparando-a com a referência.