Convide e ganhe

Como funcionam as recompensas

Compartilhe seu link. Quando um amigo se cadastrar por ele e adicionar saldo, você receberá a recompensa exibida nas recargas posteriores.

Imagem para prompt JSON: fluxo editável e verificável

Um processo independente de modelo para extrair apenas evidências visíveis, separar o que deve ficar do que pode mudar, gerar opções e aprovar o resultado com critérios claros.

Conteúdo
Imagem para prompt JSON: fluxo editável e verificável

Um prompt JSON criado a partir de uma imagem funciona melhor como uma especificação visual editável. Ele não recupera o “prompt secreto” que originou a imagem. O fluxo prático é: registrar apenas o que está visível, separar o que precisa permanecer do que será alterado, gerar várias opções e comparar cada uma com a referência usando a mesma ficha de avaliação.

O JSON ajuda a separar assunto, composição, iluminação, cores, materiais e texto. Mas os pixels não revelam o modelo exato da câmera, a tecnologia de uma luz fora do enquadramento, o nome preciso da fonte, a seed nem as palavras usadas pelo criador. O objetivo é uma semelhança controlável e testável, não uma cópia pixel a pixel.

A seguir você encontra um metaprompt pronto, uma estrutura JSON, um método de edição e critérios de aceitação.

O que este fluxo resolve

Use-o para:

  • preservar a lógica visual de uma referência e trocar apenas elementos escolhidos;
  • reutilizar a mesma especificação em modelos diferentes;
  • entender por que a saída tem o estilo certo, mas a composição errada;
  • revisar fotos, anúncios, pôsteres, interfaces e ilustrações de forma repetível.

Não chame o JSON de prompt original recuperado. A imagem final não contém todo o histórico de geração, referências ocultas, instruções ignoradas ou pós-produção.

Uma boa especificação precisa ser:

  1. Observável: toda afirmação tem apoio nos pixels.
  2. Editável: cada dimensão importante possui um campo separado.
  3. Verificável: cada campo corresponde a algo que pode ser conferido na saída.

O que preparar

Você precisa de:

  • uma referência na melhor resolução que possa usar legalmente;
  • um modelo capaz de analisar imagens;
  • um gerador ou editor de imagens;
  • um local para salvar JSON, versão do modelo, parâmetros e resultados;
  • uma frase clara sobre o que deve ficar igual e o que pode mudar.

Recorte molduras do navegador, comentários e áreas que não façam parte do design. Preserve a proporção original, a menos que alterá-la seja parte explícita da tarefa.

A documentação oficial da OpenAI sobre imagens e visão e a do Google sobre compreensão de imagens mostram que sistemas multimodais atuais podem analisar entradas visuais. As ferramentas de geração também aceitam referências ou edição iterativa. Como o formato varia por fornecedor, o método abaixo é independente de modelo.

Etapa 1: extraia um JSON de observações

Envie a imagem junto com o prompt abaixo. Ele proíbe transformar inferências invisíveis em fatos.

Atue como analista de evidências visuais. Examine a imagem de referência
anexada e devolva apenas um objeto JSON válido.

Regras:
1. Descreva somente evidências diretamente visíveis.
2. Não deduza causas ocultas, o prompt original, câmera exata, datas,
   tecnologia de iluminação invisível ou texto ilegível.
3. Use null quando um valor não puder ser determinado pela imagem.
4. Mantenha dimensões visuais diferentes em campos separados.
5. Transcreva exatamente o texto claramente legível; não adivinhe letras.
6. Explicite relações espaciais: esquerda/direita, acima/abaixo,
   primeiro plano/fundo, centralizado/deslocado, tamanho e sobreposição.
7. Antes de responder, procure contradições entre os campos.
8. Use frases completas e concretas, não listas vagas de adjetivos.

Retorne esta estrutura:
{
  "image_type": null,
  "subject": null,
  "action": null,
  "location": null,
  "composition": {
    "orientation_and_aspect_ratio": null,
    "framing_and_crop": null,
    "subject_placement": null,
    "spatial_relationships": null,
    "negative_space": null
  },
  "lighting": {
    "visible_direction": null,
    "apparent_temperature": null,
    "softness_and_contrast": null,
    "highlights_reflections_shadows": null,
    "unknown_causes": null
  },
  "color_palette": null,
  "materials_and_textures": null,
  "camera_and_focus": {
    "viewpoint": null,
    "perspective": null,
    "depth_of_field": null,
    "sharp_and_blurred_regions": null
  },
  "text_and_typography": {
    "verbatim_text": [],
    "placement_and_alignment": null,
    "size_hierarchy": null,
    "visible_lettering_style": null,
    "unreadable_text": null
  },
  "style": null,
  "mood_and_vibe": null,
  "uncertainties": [],
  "exclusions": null
}

Valide antes de gerar

Confira quatro pontos:

  • o objeto é JSON válido, sem comentários, vírgulas finais ou explicações;
  • os campos necessários estão presentes;
  • o que não pode ser confirmado aparece como null ou em uncertainties;
  • não existem contradições internas.

Os exemplos da prática de usuário que inspirou este guia mostram dois erros comuns. Na foto de um gato dentro de uma geladeira, é possível observar luz fria no interior e luz quente na cozinha, mas não provar que a lâmpada é LED. Em uma captura de site, a análise identifica corretamente o título alinhado à esquerda e, ao mesmo tempo, chama o hero de centralizado. O primeiro é uma inferência sem evidência; o segundo é uma contradição. Ambos devem bloquear a geração.

Etapa 2: separe fixo, editável e desconhecido

Classifique os dados antes de reescrever:

EstadoSignificadoExemplo
lockeddeve ser preservadoposição, hierarquia, proporção
editableserá alterado intencionalmentecor, cenário, título
unknownnão é demonstrado pela imagemlente, tipo de luz, fonte exata

Crie um objeto de controle ao lado do JSON:

{
  "locked": [
    "um assunto principal no terço inferior esquerdo",
    "grande espaço negativo à direita",
    "luz lateral suave e baixo contraste geral",
    "título acima da linha de apoio"
  ],
  "editable": {
    "subject": "substituir a caneca de cerâmica por uma garrafa de vidro transparente",
    "accent_color": "trocar vermelho discreto por azul-cobalto",
    "verbatim_text": ["NORTH", "STILL WATER"]
  },
  "unknown": [
    "modelo da câmera",
    "distância focal exata",
    "família tipográfica exata",
    "tipo físico da luz fora do quadro"
  ],
  "hard_constraints": [
    "não adicionar outro texto",
    "não alterar o ponto de vista",
    "não incluir objetos fora do layout de referência"
  ]
}

Isso comunica três ações diferentes: preservar, alterar e não inventar.

Remova conflitos

Leia a especificação em linguagem comum:

  • o assunto não pode estar centralizado e alinhado à esquerda ao mesmo tempo;
  • o recorte deve combinar com a proporção declarada;
  • luz suave não combina com sombras duras sem outra fonte visível;
  • “sem texto” não pode coexistir com um título obrigatório;
  • o mesmo objeto não pode ocupar duas posições incompatíveis.

O gerador não é obrigado a resolver essas contradições corretamente. Ele pode escolher uma opção, misturar as duas ou ignorá-las.

Etapa 3: gere um primeiro lote controlado

Entregue o JSON e o objeto de controle ao gerador. Anexe a referência quando a ferramenta aceitar image-to-image ou edição. Os guias oficiais da OpenAI e do Google documentam entradas visuais e edição iterativa, embora os recursos exatos dependam do modelo.

Use esta mensagem de passagem:

Crie uma nova imagem usando a referência anexada e a especificação JSON.

Prioridade:
1. Cumpra hard_constraints.
2. Preserve todos os itens de locked.
3. Aplique somente as mudanças de editable.
4. Trate unknown como desconhecido; não invente detalhes técnicos.
5. Iguale primeiro composição e relações espaciais, depois a textura.
6. O texto entre aspas deve aparecer exatamente uma vez, sem palavras extras.
7. Não copie marcas-d'água, assinaturas ou logotipos protegidos.

Retorne uma imagem e não explique o prompt.

Se a ferramenta ignorar JSON, transforme os mesmos dados em seções:

ASSUNTO:
COMPOSIÇÃO:
ILUMINAÇÃO:
COR:
MATERIAIS:
TEXTO:
ESTILO:
PRESERVAR:
ALTERAR:
NÃO ADICIONAR:

JSON é a fonte editável da especificação, não um protocolo universal para todos os geradores.

No primeiro lote:

  1. use a proporção da referência;
  2. registre a seed se existir, sem esperar portabilidade entre modelos;
  3. gere três ou quatro candidatos;
  4. salve JSON, referência, modelo e versão, configurações e saídas;
  5. nomeie as execuções como v01-a, v01-b e v01-c.

O sinal de sucesso é: ao menos um candidato passa por todos os critérios obrigatórios e não apresenta falha grave nos campos de maior prioridade.

Etapa 4: avalie contra a referência

Compare as imagens no mesmo tamanho. Dê:

  • 0: errado ou ausente;
  • 1: parcialmente correto;
  • 2: adequado para o uso pretendido.
CampoO que comparar
Assuntoquantidade, traços, silhueta, tamanho relativo
Composiçãoposição, corte, equilíbrio, espaço negativo, sobreposição
Relações espaciaisesquerda/direita, acima/abaixo, frente/trás
Iluminaçãodireção, temperatura, suavidade, contraste, sombras
Corcores dominantes, secundárias e de destaque e suas áreas
Materiaisbrilho, transparência, tecido, grão, pelo, metal, papel
Textoconteúdo exato, quantidade, ortografia, alinhamento, hierarquia
Estilo e climameio, acabamento, tratamento, atmosfera

Critérios obrigatórios:

  • nenhuma afirmação invisível ou sem evidência;
  • nenhuma contradição interna;
  • texto obrigatório correto;
  • relações espaciais críticas preservadas;
  • nenhum objeto, texto, logotipo ou marca-d’água não solicitado.

A soma ajuda a ordenar resultados, mas não compensa um critério obrigatório reprovado. Uma imagem bonita com o slogan errado ou o layout invertido continua inadequada.

Revise do macro para o detalhe

Ordem:

  1. tela e composição;
  2. quantidade, posição e escala;
  3. luz e grandes blocos de cor;
  4. material e textura;
  5. tipografia e detalhes.

Não aperfeiçoe textura se o assunto estiver no lado errado.

Etapa 5: altere um grupo por vez

Escolha o melhor candidato como nova base. Corrija apenas o grupo relacionado ao maior erro.

ProblemaAlterarPreservar explicitamente
Assunto grande demaisposição e escala em compositionponto de vista, luz, paleta
Layout desviourelações espaciais e espaço negativoaparência e materiais
Cena quente demaistemperatura e paletageometria e texto
Produto parece plásticomaterial, brilho e reflexãoforma, posição, rótulo
Texto erradotexto literal, quantidade, posiçãotodo o resto se houver edição
Estilo certo, identidade erradatraços do assunto ou força da referênciacomposição e fundo

Escreva: “Altere somente o título. Preserve enquadramento, ponto de vista, geometria, iluminação, cores e os demais textos”.

Os guias oficiais também recomendam separar alterações de restrições e refinar um elemento por vez. Assim cada rodada é diagnosticável.

Falhas comuns e recuperação

A saída não é JSON válido

Peça o reparo do objeto existente:

Converta o conteúdo abaixo em JSON válido. Preserve tudo o que é sustentado
pela imagem. Não acrescente novas afirmações visuais. Retorne somente JSON.

Schema ou structured output reduz erros de sintaxe, mas não comprova que a análise é verdadeira.

O gerador ignora os campos

Converta o objeto em seções de linguagem natural. Coloque PRESERVAR, ALTERAR e NÃO ADICIONAR no final e remova detalhes secundários que escondam as restrições principais.

A composição continua mudando

Adicione relações concretas:

  • “o centro do assunto fica em cerca de 30% da largura”;
  • “a borda esquerda do título segue a mesma guia da imagem”;
  • “o produto ocupa o terço inferior”;
  • “a metade direita permanece quase vazia”.

Coordenadas orientam, mas não garantem. Inspecione o resultado.

O texto exato falha

Coloque a frase entre aspas, determine quantas vezes deve aparecer, onde ficará e proíba palavras extras. Siga um fluxo text-first se o provedor recomendar. Quando a exatidão for obrigatória, planeje finalizar a tipografia em uma ferramenta de design. A documentação atual da OpenAI reconhece limitações de posicionamento e clareza de texto; a do Google também recomenda gerar o texto primeiro para imagens com lettering.

Personagem ou produto muda entre versões

Use a melhor saída anterior como imagem de edição, em vez de começar novamente. Repita um bloco curto de identidade, geometria e rótulos. Compare múltiplas execuções, pois a consistência de personagens, marcas e layouts precisos ainda pode variar.

A solicitação falha antes da imagem

Registre o erro e o request ID. Corrija autenticação, quota, entrada ou moderação antes de repetir. Use backoff apenas para rate limit temporário ou erro de servidor; mude primeiro solicitações corrigíveis pelo usuário.

Salve um registro de aceitação

{
  "run_id": "v03-b",
  "reference_file": "reference.png",
  "analysis_json": "reference.v01.json",
  "generator_and_version": "registrar-o-valor-real",
  "settings": {
    "aspect_ratio": "registrar-o-valor-real",
    "quality": "registrar-o-valor-real",
    "seed": null
  },
  "scores": {
    "subject": 2,
    "composition": 2,
    "spatial_relations": 2,
    "lighting": 1,
    "color": 2,
    "materials": 1,
    "text": 2,
    "style_and_mood": 2
  },
  "hard_gates": {
    "unsupported_claims": false,
    "contradictions": false,
    "required_text_wrong": false,
    "critical_layout_wrong": false,
    "unrequested_elements": false
  },
  "decision": "accept",
  "next_change": null
}

Isso transforma “prefiro a versão B” em uma decisão auditável e mostra se trocar de modelo melhorou a qualidade ou apenas mudou o estilo.

Perguntas frequentes

É possível recuperar o prompt original exato?

Não. É possível criar uma descrição útil das evidências visíveis. O processo original pode ter usado referências ocultas, seeds, configurações, instruções descartadas, múltiplas edições e pós-produção.

O que escrever sobre câmera e luz?

Descreva efeitos visíveis: ponto de vista, perspectiva, profundidade de campo, suavidade das sombras, direção aparente e temperatura. Não afirme equipamento exato nem tecnologia invisível sem outra fonte verificada.

Todo gerador aceita JSON?

Não. Mantenha JSON como especificação principal e converta-o para o formato que a ferramenta escolhida segue melhor.

Quantas iterações devo fazer?

Comece com três ou quatro candidatos, escolha a base mais forte e altere um grupo por rodada. Pare quando todos os critérios obrigatórios passarem e novas mudanças não melhorarem o uso real.

Uma alta semelhança geral é suficiente?

Não. Ela pode esconder texto errado, layout invertido, objeto extra ou logotipo inventado. A revisão por campo continua necessária.

Fontes e nível de evidência

O ponto central independe do fornecedor: mantenha evidências observáveis em uma estrutura, declare as alterações com clareza e aceite a saída comparando-a com a referência.

Quer otimizar seu fluxo de trabalho com LLMs?

Conecte modelos por uma única API, gerencie chaves e controle os gastos com IA.

Começar grátis