Bild in JSON-Prompt umwandeln und Ergebnis prüfen
Ein modellunabhängiger Ablauf: nur sichtbare Merkmale erfassen, feste und veränderbare Felder trennen, mehrere Varianten erzeugen und das Ergebnis mit klaren Kriterien abnehmen.
Inhalt

Ein JSON-Prompt aus einem Bild ist vor allem eine editierbare visuelle Spezifikation. Er rekonstruiert nicht den „geheimen Originalprompt“, mit dem das Bild entstanden ist. Der belastbare Ablauf lautet: nur sichtbare Merkmale erfassen, unveränderliche und veränderbare Elemente trennen, mehrere Kandidaten erzeugen und jeden Kandidaten mit derselben Prüfliste gegen die Referenz bewerten.
JSON hilft, Motiv, Komposition, Licht, Farben, Materialien und Text getrennt zu behandeln. Aus den fertigen Pixeln lassen sich jedoch weder das genaue Kameramodell noch die Technik einer Lichtquelle außerhalb des Bildes, der exakte Schriftname, der Seed oder die ursprünglichen Worte des Erstellers zuverlässig ableiten. Ziel ist deshalb eine steuerbare und überprüfbare visuelle Annäherung, keine pixelgenaue Kopie.
Im Folgenden erhalten Sie einen sofort nutzbaren Analyse-Prompt, ein JSON-Schema, ein Bearbeitungsverfahren und feste Abnahmekriterien.
Wofür sich der Ablauf eignet
Nutzen Sie ihn, wenn Sie:
- die visuelle Logik einer Referenz erhalten und nur ausgewählte Details ändern wollen;
- dieselbe Spezifikation mit mehreren Bildmodellen vergleichen möchten;
- herausfinden wollen, warum ein Ergebnis stilistisch passt, aber im Aufbau abweicht;
- Fotos, Anzeigen, Poster, Interfaces und Illustrationen wiederholbar prüfen müssen.
Bezeichnen Sie das JSON nicht als wiederhergestellten Originalprompt. Ein Endbild enthält nicht die vollständige Generierungshistorie, versteckte Referenzen, verworfene Anweisungen oder Nachbearbeitung.
Eine gute Spezifikation ist:
- Beobachtbar: Jede Tatsachenbehauptung lässt sich im Bild belegen.
- Editierbar: Wichtige visuelle Dimensionen haben getrennte Felder.
- Prüfbar: Jedes Feld lässt sich im Ergebnis kontrollieren.
Was Sie vorbereiten sollten
Benötigt werden:
- die Referenz in der höchsten rechtmäßig nutzbaren Auflösung;
- ein Modell mit Bildverständnis;
- ein Bildgenerator oder Bildeditor;
- ein Speicherort für JSON, Modellversion, Einstellungen und Ausgaben;
- ein klarer Satz dazu, was gleich bleiben muss und was verändert werden darf.
Schneiden Sie Browserrahmen, Kommentare und fremde Ränder weg. Behalten Sie das ursprüngliche Seitenverhältnis bei, sofern seine Änderung nicht Teil der Aufgabe ist.
Die offiziellen Dokumentationen von OpenAI zu Bildern und Vision und Google zum Bildverständnis beschreiben die Analyse von Bildeingaben. Die jeweiligen Generierungswerkzeuge unterstützen außerdem Referenzbilder oder iterative Bearbeitung. Da sich das Request-Format je Anbieter unterscheidet, bleibt der folgende Prozess modellunabhängig.
Schritt 1: Beobachtungs-JSON aus der Referenz erzeugen
Senden Sie das Bild zusammen mit diesem Prompt. Er verhindert, dass unsichtbare Annahmen als Fakten ausgegeben werden.
Du analysierst visuelle Belege. Untersuche das angehängte Referenzbild
und gib ausschließlich ein gültiges JSON-Objekt zurück.
Regeln:
1. Beschreibe nur direkt sichtbare Belege.
2. Leite keine verborgenen Ursachen, den Originalprompt, exakte Kameratechnik,
exakte Daten, unsichtbare Lichttechnik oder unlesbaren Text ab.
3. Verwende null, wenn ein Wert aus dem Bild nicht bestimmbar ist.
4. Trenne unterschiedliche visuelle Dimensionen in eigene Felder.
5. Schreibe klar lesbaren Text exakt ab; errate keine fehlenden Zeichen.
6. Beschreibe räumliche Beziehungen: links/rechts, oben/unten,
Vordergrund/Hintergrund, zentriert/versetzt, relative Größe und Überlappung.
7. Prüfe vor der Ausgabe auf Widersprüche zwischen Feldern.
8. Verwende konkrete vollständige Sätze statt vager Adjektivlisten.
Gib diese Struktur zurück:
{
"image_type": null,
"subject": null,
"action": null,
"location": null,
"composition": {
"orientation_and_aspect_ratio": null,
"framing_and_crop": null,
"subject_placement": null,
"spatial_relationships": null,
"negative_space": null
},
"lighting": {
"visible_direction": null,
"apparent_temperature": null,
"softness_and_contrast": null,
"highlights_reflections_shadows": null,
"unknown_causes": null
},
"color_palette": null,
"materials_and_textures": null,
"camera_and_focus": {
"viewpoint": null,
"perspective": null,
"depth_of_field": null,
"sharp_and_blurred_regions": null
},
"text_and_typography": {
"verbatim_text": [],
"placement_and_alignment": null,
"size_hierarchy": null,
"visible_lettering_style": null,
"unreadable_text": null
},
"style": null,
"mood_and_vibe": null,
"uncertainties": [],
"exclusions": null
}
JSON vor der Generierung prüfen
Kontrollieren Sie vier Punkte:
- Das Objekt ist ohne Kommentare, nachgestellte Kommas oder Zusatztext als JSON parsebar.
- Alle erforderlichen Felder sind vorhanden.
- Unbekanntes steht als
nulloder inuncertainties. - Die Felder widersprechen sich nicht.
Die Nutzerpraxis, die diesen Leitfaden angeregt hat, zeigt zwei typische Fehler. Auf einem Foto einer Katze im Kühlschrank sind kühles Licht innen und warmes Licht in der Küche sichtbar. Dass die Lampe eine LED ist, lässt sich aus dem Foto aber nicht ableiten. Bei einem Website-Screenshot wurde die linksbündige Überschrift korrekt erkannt, der Hero-Bereich jedoch zugleich als zentriert und linksbündig beschrieben. Der erste Fall ist eine unbelegte Schlussfolgerung, der zweite ein interner Widerspruch. Beide müssen die Generierung stoppen.
Schritt 2: Fest, veränderbar und unbekannt trennen
Schreiben Sie nicht sofort das gesamte JSON um. Ordnen Sie die Inhalte zunächst drei Zuständen zu:
| Zustand | Bedeutung | Beispiel |
|---|---|---|
locked | muss erhalten bleiben | Motivposition, Hierarchie, Seitenverhältnis |
editable | wird bewusst geändert | Produktfarbe, Umgebung, Überschrift |
unknown | aus dem Bild nicht belegbar | Objektiv, Lichttyp, exakte Schrift |
Legen Sie neben dem Beobachtungs-JSON ein Steuerobjekt an:
{
"locked": [
"ein Hauptmotiv im unteren linken Drittel",
"große freie Fläche rechts",
"weiches Seitenlicht und insgesamt geringer Kontrast",
"Überschrift über der unterstützenden Zeile"
],
"editable": {
"subject": "Keramiktasse durch eine transparente Glasflasche ersetzen",
"accent_color": "gedämpftes Rot in Kobaltblau ändern",
"verbatim_text": ["NORTH", "STILL WATER"]
},
"unknown": [
"Kameramodell",
"exakte Brennweite",
"exakte Schriftfamilie",
"physischer Typ der Lichtquelle außerhalb des Bildes"
],
"hard_constraints": [
"keinen weiteren Text hinzufügen",
"Blickwinkel nicht ändern",
"keine Objekte außerhalb des Referenzlayouts ergänzen"
]
}
Damit erhält der Generator drei unterschiedliche Anweisungen: bewahren, verändern und nicht erfinden.
Konflikte beseitigen
Lesen Sie die Spezifikation als normalen Text:
- Ein Motiv kann nicht gleichzeitig zentriert und linksbündig sein.
- Die Crop-Beschreibung muss zum Seitenverhältnis passen.
- Weiches diffuses Licht und harte Schatten benötigen einen sichtbaren Grund.
- „Kein Text“ darf nicht neben einer Pflichtüberschrift stehen.
- Dasselbe Objekt darf nicht an zwei unvereinbaren Positionen erscheinen.
Ein Generator löst widersprüchliche Vorgaben nicht zuverlässig. Er kann zufällig eine wählen, beide vermischen oder beide ignorieren.
Schritt 3: Erste kontrollierte Serie erzeugen
Übergeben Sie Beobachtungs-JSON und Steuerobjekt an den Generator. Fügen Sie die Referenz hinzu, wenn image-to-image oder Bearbeitung unterstützt wird. Die offiziellen Leitfäden von OpenAI und Google dokumentieren Bildeingaben und iterative Bearbeitung; die genaue Funktionalität hängt jedoch vom gewählten Modell ab.
Verwenden Sie diesen Übergabe-Prompt:
Erzeuge anhand der angehängten Referenz und der JSON-Spezifikation ein neues Bild.
Priorität:
1. hard_constraints einhalten.
2. Alle Einträge in locked bewahren.
3. Nur die Änderungen aus editable anwenden.
4. unknown unbekannt lassen und keine technischen Details erfinden.
5. Zuerst Komposition und räumliche Beziehungen treffen, danach Texturen.
6. Text in Anführungszeichen exakt einmal und ohne zusätzliche Wörter darstellen.
7. Keine Wasserzeichen, Signaturen oder geschützten Logos kopieren.
Gib ein Bild zurück und erkläre den Prompt nicht.
Wenn der Generator rohes JSON ignoriert, wandeln Sie dieselben Daten in beschriftete Abschnitte um:
MOTIV:
KOMPOSITION:
LICHT:
FARBE:
MATERIALIEN:
TEXT:
STIL:
BEWAHREN:
ÄNDERN:
NICHT HINZUFÜGEN:
JSON ist die editierbare Quelle Ihrer Spezifikation, aber kein universelles Protokoll aller Bildmodelle.
Für die erste Serie:
- Seitenverhältnis der Referenz verwenden;
- Seed aufzeichnen, falls vorhanden, aber keine Portabilität erwarten;
- drei oder vier Kandidaten erzeugen;
- JSON, Referenz, Modell und Version, Einstellungen und Ausgaben speichern;
- Runs etwa als
v01-a,v01-b,v01-cbenennen.
Das Erfolgssignal ist nicht „sieht gut aus“. Es lautet: Mindestens ein Kandidat besteht alle Pflichtkriterien und hat in den wichtigsten Feldern keinen schweren Fehler.
Schritt 4: Ergebnis gegen die Referenz bewerten
Vergleichen Sie beide Bilder in derselben Größe. Vergeben Sie:
0: falsch oder fehlt;1: teilweise richtig;2: für den Zweck akzeptabel.
| Feld | Was verglichen wird |
|---|---|
| Motiv | Anzahl, Merkmale, Silhouette, relative Größe |
| Komposition | Position, Zuschnitt, Balance, Leerraum, Überlappung |
| Räumliche Beziehungen | links/rechts, oben/unten, davor/dahinter |
| Licht | Richtung, Temperatur, Weichheit, Kontrast, Schatten |
| Farbe | Haupt-, Neben- und Akzentfarben samt Position |
| Materialien | Glanz, Transparenz, Stoff, Körnung, Fell, Metall, Papier |
| Text | exakter Wortlaut, Anzahl, Rechtschreibung, Ausrichtung, Hierarchie |
| Stil und Stimmung | Medium, Finish, Behandlung, Atmosphäre |
Pflichtkriterien:
- keine unsichtbare oder unbelegte Behauptung;
- kein interner Widerspruch;
- Pflichttext ist korrekt;
- kritische räumliche Beziehungen bleiben erhalten;
- keine unerwünschten Logos, Wasserzeichen, Objekte oder Wörter.
Die Gesamtpunktzahl kann Kandidaten sortieren, aber kein verfehltes Pflichtkriterium ausgleichen. Ein schönes Bild mit falschem Slogan oder gespiegeltem Layout ist weiterhin ungeeignet.
Vom Groben zum Detail prüfen
Reihenfolge:
- Leinwand und Komposition;
- Anzahl, Position und Größe der Motive;
- Licht und große Farbflächen;
- Materialien und Texturen;
- Typografie und kleine Details.
Es lohnt sich nicht, Fellstruktur zu optimieren, wenn das Motiv auf der falschen Seite steht.
Schritt 5: Pro Runde nur eine Feldgruppe ändern
Wählen Sie den besten Kandidaten als neue Basis. Korrigieren Sie nur die Feldgruppe, die zum größten Fehler gehört.
| Fehler | Ändern | Ausdrücklich erhalten |
|---|---|---|
| Motiv zu groß | Position und Maßstab in composition | Blickwinkel, Licht, Palette |
| Layout driftet | räumliche Beziehungen und Leerraum | Motivdetails, Materialien |
| Bild zu warm | Lichttemperatur und Palette | Geometrie und Text |
| Produkt wirkt wie Kunststoff | Material, Glanz, Reflexionen | Form, Position, Etikett |
| Text ist falsch | exakter Text, Anzahl, Position | bei Bearbeitung alle Nicht-Text-Bereiche |
| Stil passt, Identität nicht | Motivmerkmale oder Referenzstärke | Komposition und Hintergrund |
Formulieren Sie: „Ändere nur den Überschriftentext. Behalte Zuschnitt, Blickwinkel, Objektgeometrie, Licht, Farben und alle anderen Texte unverändert.“
Offizielle Prompting-Leitfäden empfehlen ebenfalls, Änderungen von Erhaltungsbedingungen zu trennen und jeweils nur einen Punkt zu verfeinern. So bleibt jede Iteration nachvollziehbar.
Häufige Fehler und Abhilfe
Ausgabe ist kein gültiges JSON
Lassen Sie die vorhandene Antwort reparieren:
Repariere den folgenden Inhalt zu gültigem JSON.
Bewahre alle durch das Bild belegten Angaben. Füge keine neue visuelle Behauptung hinzu.
Gib nur JSON zurück.
Schema oder structured output reduzieren Syntaxfehler, beweisen aber nicht die inhaltliche Richtigkeit.
Der Generator ignoriert die Felder
Wandeln Sie das Objekt in beschriftete Abschnitte um. Stellen Sie BEWAHREN, ÄNDERN und NICHT HINZUFÜGEN ans Ende. Entfernen Sie Details niedriger Priorität, wenn sie zentrale Vorgaben verdecken.
Die Komposition driftet weiter
Ergänzen Sie konkrete Beziehungen:
- „Motivzentrum bei ungefähr 30 % der Bildbreite“;
- „linke Kante der Überschrift auf derselben Führung wie das Bild“;
- „Produkt belegt das untere Drittel“;
- „rechte Hälfte bleibt größtenteils leer“.
Koordinaten sind Hinweise, keine Garantie. Prüfen Sie die Ausgabe.
Exakter Text bleibt falsch
Setzen Sie die Zeichenfolge in Anführungszeichen, geben Sie Anzahl und Position an und verbieten Sie weiteren Text. Folgen Sie einem text-first-Ablauf, wenn der Anbieter ihn empfiehlt. Ist die Formulierung zwingend korrekt, planen Sie die finale Typografie in einem Designwerkzeug. Die aktuelle OpenAI-Dokumentation nennt Grenzen bei genauer Textplatzierung und Lesbarkeit; Google empfiehlt bei Bildtext ebenfalls, den Text zuerst festzulegen.
Figur oder Produkt verändert sich
Verwenden Sie die beste vorherige Ausgabe als Bearbeitungseingabe statt jedes Mal neu zu starten. Wiederholen Sie einen kurzen Identitätsblock sowie Geometrie und Etiketten. Vergleichen Sie mehrere Runs, da wiederkehrende Figuren, Markenelemente und präzise Layouts noch schwanken können.
Request schlägt vor dem Bild fehl
Speichern Sie Fehler und request ID. Beheben Sie Authentifizierung, Quota, Eingabeformat oder Moderation zuerst. Nur vorübergehende Rate-Limit- oder Serverfehler mit Backoff wiederholen; benutzerkorrigierbare Requests zuerst ändern.
Abnahmeprotokoll speichern
{
"run_id": "v03-b",
"reference_file": "reference.png",
"analysis_json": "reference.v01.json",
"generator_and_version": "tatsächlichen-wert-eintragen",
"settings": {
"aspect_ratio": "tatsächlichen-wert-eintragen",
"quality": "tatsächlichen-wert-eintragen",
"seed": null
},
"scores": {
"subject": 2,
"composition": 2,
"spatial_relations": 2,
"lighting": 1,
"color": 2,
"materials": 1,
"text": 2,
"style_and_mood": 2
},
"hard_gates": {
"unsupported_claims": false,
"contradictions": false,
"required_text_wrong": false,
"critical_layout_wrong": false,
"unrequested_elements": false
},
"decision": "accept",
"next_change": null
}
Damit wird „Variante B gefällt mir besser“ zu einer nachvollziehbaren Entscheidung. Das Protokoll zeigt auch, ob ein Modellwechsel die Qualität verbessert oder nur den Stil verändert hat.
Häufige Fragen
Lässt sich der exakte Originalprompt wiederherstellen?
Nein. Aus sichtbaren Merkmalen lässt sich eine nützliche Beschreibung erstellen. Der ursprüngliche Ablauf kann versteckte Referenzen, Seeds, Einstellungen, verworfene Anweisungen, mehrere Bearbeitungen und Nachbearbeitung enthalten haben.
Was gehört in Kamera- und Lichtfelder?
Beschreiben Sie sichtbare Wirkungen: Blickwinkel, Perspektive, Schärfentiefe, Schattenweichheit, scheinbare Lichtrichtung und Farbtemperatur. Behaupten Sie ohne weitere verifizierte Quelle keine exakte Technik.
Akzeptiert jeder Bildgenerator JSON?
Nein. Bewahren Sie JSON als Masterspezifikation auf und übertragen Sie es in das Format, dem Ihr Zielwerkzeug am besten folgt.
Wie viele Iterationen sind sinnvoll?
Starten Sie mit drei oder vier Kandidaten, wählen Sie die beste Basis und ändern Sie pro Runde eine Feldgruppe. Stoppen Sie, wenn alle Pflichtkriterien erfüllt sind und weitere Änderungen den praktischen Nutzen nicht verbessern.
Reicht ein hoher Ähnlichkeitswert?
Nein. Er kann falschen Text, ein gespiegeltes Layout, zusätzliche Objekte oder erfundene Logos verbergen. Die feldweise Prüfung bleibt erforderlich.
Quellen und Evidenzstufe
- Vox-Thread auf X: berichtete Nutzerpraxis, die die Feldtrennung angeregt hat; kein unabhängiger Benchmark.
- OpenAI: Images and vision, Image generation und Image prompting: offizielle Dokumentation zu Bildeingaben, Bearbeitung, Struktur, Bewertung und Grenzen.
- Google: Image understanding und Image generation: offizielle Dokumentation zu Analyse, strukturiertem JSON, Referenzen, Iteration und Grenzen.
Der Kern ist anbieterunabhängig: Speichern Sie beobachtbare Fakten in einer Struktur, formulieren Sie Änderungen eindeutig und nehmen Sie die Ausgabe im Vergleich zur Referenz ab.