Drift bei mehreren Bildreferenzen: Layout und Stil sauber trennen
Behandeln Sie jedes Referenzbild als eigene Anweisung. Dieser Leitfaden zeigt, wie Sie Layout, Motiv und Stil trennen, die Ursache von Drift eingrenzen und attraktive Ergebnisse ablehnen, wenn sie den vorgesehenen Bildaufbau verfehlen.
Inhalt

Sie übergeben einem Bildgenerator eine Layoutreferenz, eine Stilreferenz und ein Bild des Motivs. Die Anfrage läuft ohne Fehler durch, doch das Ergebnis wirkt wie generische Stockgrafik: Das Motiv wandert an eine andere Stelle, der für eine Überschrift reservierte Freiraum verschwindet und mehrere Bildstile verschmelzen zu einem unbestimmten „KI-Look“. Reagieren Sie darauf nicht einfach mit noch mehr Prompt-Text. Geben Sie zuerst jeder Referenz eine eindeutige Aufgabe und vergleichen Sie das Ergebnis anschließend Punkt für Punkt mit der vorgesehenen Komposition.
In einem öffentlichen Bericht hatte ein Agent mehrere Stilreferenzen in einen einzigen flachen Parameter verkettet. Das Modell bildete daraus eine Art Durchschnitt und lieferte generische Texturen zurück, ohne dass ein API-Fehler auftrat. Dieser einzelne Bericht belegt kein universelles Modellverhalten, macht aber einen wichtigen Unterschied sichtbar: Eine technisch erfolgreiche Anfrage ist nicht automatisch eine visuell erfolgreiche Aufgabe.
Die praktische Regel: Ein Bild steuert die Komposition, ein anderes die Erscheinung
Die wichtigste Änderung besteht darin, nicht alle Bilder als gleichrangige, unerklärte Referenzliste zu behandeln. Trennen Sie mindestens diese drei Rollen:
| Rolle der Referenz | Was sie steuern soll | Was sie nicht steuern soll |
|---|---|---|
| Layoutreferenz | Anzahl der Motive, Position, relative Größe, Kamera, Ausschnitt und Negativraum | Farbpalette, Material, Pinselwirkung oder Lichtstil |
| Motivreferenz | Identität, Form und charakteristische Merkmale einer Person oder eines Objekts | Gesamtkomposition oder unbeteiligte Hintergrundobjekte |
| Stilreferenz | Palette, Textur, Linienqualität, Körnung, Beleuchtung und Renderingsprache | Objekte, Text oder Komposition des Referenzbilds |
Wenn die Aufgabe nur Layout und Stil benötigt, verwenden Sie nur diese beiden Bilder. Mehr Referenzen bedeuten nicht automatisch mehr Kontrolle; sie können auch widersprüchliche Signale hinzufügen, die das System ausgleichen muss.
Warum eine flache Referenzliste oft einen generischen Kompromiss erzeugt
Eine flache Liste sagt lediglich: „Alle diese Bilder sind wichtig.“ Sie erklärt aber nicht, wofür jedes Bild wichtig ist. Das Modell oder ein vorgeschalteter Agent muss die Beziehung erraten. So können die Farbe aus einem Bild, die Textur aus einem zweiten und ein unerwünschtes Objekt aus einem dritten Bild zusammenfließen – zu einem plausiblen, aber am Ziel vorbeigehenden Kompromiss.
Dabei muss kein technischer Fehler entstehen. Authentifizierung, Upload, Request-Syntax und Antwortverarbeitung können vollständig funktionieren. Ein erfolgreicher HTTP-Status oder die Meldung „generation completed“ ist deshalb kein visuelles Abnahmekriterium. Nach der Generierung braucht der Ablauf eine Prüfung der Komposition.
Schritt 1: Formulieren Sie für jede Referenz einen Rollenvertrag
Bevor Sie einen langen Prompt schreiben, beantworten Sie für jedes Bild vier Fragen:
- Was muss erhalten bleiben? Zum Beispiel: Das Motiv bleibt unten links, der obere Bereich bleibt für eine Überschrift frei und die Kamera behält einen niedrigen Winkel.
- Was muss ignoriert werden? Zum Beispiel: Identität der Person, Markentext und Hintergrundarchitektur aus der Stilreferenz dürfen nicht übernommen werden.
- Wie strikt ist die Vorgabe? Ist die Komposition eine harte Bedingung und die Farbe nur eine Präferenz – oder umgekehrt?
- Welche Referenz gewinnt bei einem Konflikt? Zum Beispiel: Die Layoutreferenz hat bei der Objektposition Vorrang vor einer Anordnung, die das Stilbild nahelegt.
Ein brauchbarer Rollenvertrag kann so aussehen:
| Datei | Rolle | Erhalten | Ignorieren | Konfliktregel |
|---|---|---|---|---|
layout.png | Layout | Zwei Motive mit Groß-klein-Verhältnis, Freiraum rechts, Draufsicht | Farbe und Material | Räumliche Beziehungen haben Vorrang vor allen anderen Referenzen |
subject.png | Motiv | Silhouette und charakteristische Details | Ursprünglicher Hintergrund und Kamera | Motiv ersetzen, ohne seine Position im Layout zu ändern |
style.png | Stil | Warmgraue Palette, Papierkörnung, weiche Schatten | Personen und Text im Bild | Nur die Erscheinung übertragen, nicht den Inhalt |
Das ist hilfreicher als „Referenz 1, 2 und 3“, weil sowohl gewünschte Signale als auch verbotene Übernahmen festgelegt sind.
Schritt 2: Ersetzen Sie die flache Liste durch eine hierarchische Anfrage
Die tatsächlichen API-Felder unterscheiden sich je nach Werkzeug. Das folgende Beispiel ist eine konzeptionelle Struktur und kein realer Vertrag eines Anbieters. Nutzen Sie sie, um zu prüfen, ob Ihr Agent die Rolleninformationen bis zur endgültigen Anfrage erhält:
references:
- id: layout
source: layout.png
role: composition
preserve: [subject_count, position, scale, camera, negative_space]
- id: subject
source: subject.png
role: identity
preserve: [shape, distinctive_details]
- id: style
source: style.png
role: appearance
preserve: [palette, texture, line_quality, lighting]
exclude: [objects, text, composition]
priority:
- layout
- subject
- style
acceptance_reference: layout.png
Entscheidend ist nicht, ob Ihre API genau diese Feldnamen verwendet. Entscheidend ist, ob dieselbe Bedeutung die gesamte Verarbeitungskette überlebt. Prüfen Sie die Anfrage, die der Agent tatsächlich sendet: Wurde ein Bild-Array zu einer verketteten Zeichenfolge? Sind Rollenbeschreibungen in allgemeinem Fließtext verschwunden? Haben Wiederholungen oder Stapelverarbeitung die Dateireihenfolge verändert?
Wenn die Ziel-API getrennte Referenztypen, Gewichtungen oder Bearbeitungsmasken dokumentiert, übertragen Sie den Rollenvertrag in dieses Schema. Wenn sie das nicht tut, erfinden Sie keine Parameter. Wechseln Sie zu einem gestuften Ablauf.
Schritt 3: Arbeiten Sie zweistufig, wenn das Werkzeug keine Rollen ausdrücken kann
Akzeptiert die Oberfläche nur eine undifferenzierte Bildmenge, fixieren Sie zuerst die Komposition und wenden den Stil anschließend an. Zwei getrennte Transformationen lassen sich meist leichter untersuchen als eine einzige Anfrage, die alle Signale gleichzeitig verarbeiten soll.
Stufe A: Komposition und Motiv festlegen
Verwenden Sie die Layoutreferenz und ergänzen Sie die Motivreferenz nur, wenn sie wirklich benötigt wird. Beschreiben Sie Anzahl, Platzierung, Kamera, Ausschnitt und Negativraum. Material und Renderingsprache bleiben in dieser Stufe außen vor. Ziel ist ein strukturell korrektes Bild, auch wenn es zunächst schlicht aussieht.
Stufe B: Erscheinung anwenden, ohne die Szene neu aufzubauen
Nutzen Sie das Ergebnis aus Stufe A als neues Ausgangsbild und bearbeiten oder zeichnen Sie es mit der Stilreferenz neu. Legen Sie fest, dass Positionen und Grenzen der Motive, Kamera, Ausschnitt und Negativraum unverändert bleiben; nur Palette, Textur, Linienqualität und Beleuchtung dürfen sich ändern.
Unterstützt das Werkzeug Masken, öffnen Sie nur die Bereiche, die bearbeitet werden sollen. Ohne Bearbeitungsmodus bleibt das Ergebnis aus Stufe A die primäre Referenz und das Stilbild die sekundäre. Ob explizite Gewichtungen verfügbar sind, hängt von der aktuellen Dokumentation des jeweiligen Werkzeugs ab.
Schritt 4: Führen Sie vier kontrollierte Varianten aus, um das verlorene Signal zu finden
Ändern Sie nicht immer wieder denselben komplexen Request. Halten Sie Prompt, Abmessungen und andere steuerbare Einstellungen konstant und erzeugen Sie vier Varianten:
| Test | Eingabe | Was zu prüfen ist |
|---|---|---|
| A | Nur Layoutreferenz | Bleiben Motivanzahl, Positionen, Kamera, Ausschnitt und Negativraum erhalten? |
| B | Nur Stilreferenz | Welche Eigenschaften von Palette, Textur, Linie und Licht werden tatsächlich übertragen? |
| C | Layout und Stil als flache Liste | Entsteht ein Kompromiss, eine Stilmittelung oder unerwünschter Inhalt? |
| D | Layout und Stil mit expliziten Rollen und Priorität | Liegt jedes Ziel näher am Soll als in Test C? |
Das ist kein Test, ob ein Modell „gut“ oder „schlecht“ ist. Er zeigt, ob der Bruch bereits bei der Interpretation eines einzelnen Bildes, bei der Kombination mehrerer Bilder oder bei der Parameterverarbeitung des Agenten entsteht. Wenn A und B funktionieren, C driftet und D sich verbessert, ist Rollenunklarheit ein starker Verdacht. Wenn D genauso aussieht wie C, prüfen Sie den finalen Payload oder verwenden Sie das zweistufige Verfahren.
Falls das Werkzeug einen Seed unterstützt, verwenden Sie in allen Varianten denselben Wert, um Zufallsschwankungen zu reduzieren. Ohne Seed sollten Sie den Vergleich nicht als deterministisch darstellen; erzeugen Sie mehrere Beispiele pro Variante und achten Sie auf wiederkehrende strukturelle Fehler.
Schritt 5: Nehmen Sie gegen die Zielkomposition ab, nicht nach „sieht gut aus“
Ein gefährliches Ergebnis ist nicht zwingend hässlich. Es kann so ausgearbeitet wirken, dass es eine schnelle Sichtprüfung besteht, obwohl es das eigentliche Template verfehlt. Prüfen Sie harte Bedingungen, bevor Sie den Stil bewerten.
Harte Bedingungen: Bei einem Fehler den Kandidaten verwerfen
- Die Anzahl der Motive stimmt.
- Positionen und relative Größen entsprechen dem Layout.
- Kamerarichtung, Ausschnitt und Perspektive sind korrekt.
- Reservierter Textbereich oder Negativraum bleibt verfügbar.
- Objekte, Personen oder Texte aus der Stilreferenz sind nicht in das Ergebnis gelangt.
- Charakteristische Merkmale des Motivs bleiben erkennbar.
Weiche Bedingungen: Damit ordnen Sie die verbleibenden Kandidaten
- Die Palette liegt nahe am Ziel.
- Textur und Körnung wirken beabsichtigt statt verschmiert.
- Linien, Kanten und Schatten entsprechen der gewünschten Bildsprache.
- Das Ergebnis wirkt geschlossen und nicht wie ein Durchschnitt mehrerer Stile.
Stellen Sie Layoutreferenz und Kandidat nebeneinander und protokollieren Sie für jede harte Bedingung bestanden oder nicht bestanden. Speichern Sie nicht nur das Endbild, sondern auch Request-Version, Referenzreihenfolge und den exakten Payload des Agenten. So lässt sich die nächste Drift reproduzieren.
Häufige Symptome in der richtigen Reihenfolge untersuchen
| Symptom | Zuerst prüfen | Bevorzugte Reaktion |
|---|---|---|
| Stil ist stark, aber die Komposition verändert sich | Wurde das Stilbild als gleichrangige Hauptreferenz behandelt? | Layout höher priorisieren oder Komposition und Stil in Stufen trennen |
| Komposition stimmt, aber der Stil ist schwach | Enthält der Prompt nur abstrakte Stimmungswörter? | Beobachtbare Merkmale von Palette, Material, Linie und Licht benennen |
| Mehrere Stile verschmelzen zu einem generischen Look | Sind widersprüchliche Stilbilder gleichzeitig enthalten? | Eine dominante Stilreferenz wählen; weitere Bilder nur je ein Merkmal liefern lassen |
| Das Motiv des Stilbilds erscheint im Ergebnis | Wurde festgelegt, dass nur die Erscheinung übertragen wird? | Objekte, Text und Komposition ausdrücklich ausschließen |
| Prompt-Änderungen zeigen keine Wirkung | Hat der Agent die neuen Parameter tatsächlich gesendet? | Finale Payloads statt nur des vorgelagerten Formulars vergleichen |
| API ist erfolgreich, Bilder driften dennoch | Wird technischer Erfolg als visuelle Abnahme verwendet? | Harte Kompositionsgrenzen und kontrollierte Vergleiche ergänzen |
Ein wiederverwendbarer Minimalablauf
- Wählen Sie nur die Referenzen aus, die für die Aufgabe notwendig sind.
- Geben Sie jedem Bild eine Hauptrolle sowie Regeln zum Erhalten, Ignorieren und Lösen von Konflikten.
- Prüfen Sie den finalen Agenten-Request darauf, dass Arrays, Reihenfolge und Rollen nicht verflacht wurden.
- Erzeugen Sie zuerst Basisvarianten nur mit Layout und nur mit Stil, bevor Sie flache und rollentrennte Varianten vergleichen.
- Verwerfen Sie Kandidaten anhand harter Kompositionsbedingungen, bevor Sie Stilunterschiede bewerten.
- Speichern Sie Kandidaten, Referenzen, Request-Versionen und Abnahmeergebnisse gemeinsam.
- Kann die Oberfläche keine Rollen abbilden, bearbeiten Sie zuerst die Komposition und danach den Stil.
Das Ziel ist kein längerer Prompt. Das Ziel ist ein Ablauf, in dem jedes visuelle Signal einen Verantwortlichen hat. Solange Sie beantworten können, welches Bild ein Merkmal steuert, welche Regel einen Konflikt gewinnt und was als bestanden gilt, sind mehrere Referenzen kein ungeordneter Bildstapel mehr, den das Modell allein interpretieren muss.