Invitez et gagnez

Fonctionnement des récompenses

Partagez votre lien. Lorsqu’un ami s’inscrit avec ce lien et recharge son solde, vous recevez la récompense affichée sur ses recharges ultérieures.

Dérive avec plusieurs références : séparez composition et style

Traitez chaque image de référence comme une consigne distincte. Ce guide explique comment séparer composition, sujet et style, repérer où commence la dérive et rejeter un résultat séduisant qui ne respecte pas la structure prévue.

Sommaire
Dérive avec plusieurs références : séparez composition et style

Vous fournissez à un outil de génération une référence de mise en page, une référence de style et une image du sujet. La requête aboutit, mais le résultat ressemble à une illustration générique de photothèque : le sujet change de place, l’espace prévu pour le titre disparaît et plusieurs styles se fondent dans une esthétique « IA » indistincte. N’ajoutez pas simplement davantage de texte au prompt. Commencez par attribuer une mission précise à chaque référence, puis comparez le résultat, critère par critère, à la composition attendue.

Dans un témoignage public, un agent avait concaténé plusieurs références de style dans un paramètre unique et non structuré. Le modèle a produit une sorte de moyenne des entrées et renvoyé des textures génériques sans erreur d’API. Ce cas isolé ne prouve pas un comportement universel, mais il met en évidence une distinction essentielle : une requête techniquement réussie n’est pas nécessairement une tâche visuelle réussie.

Règle pratique : une image pilote la composition, une autre l’apparence

Le changement le plus utile consiste à ne plus traiter toutes les images comme une liste de références équivalentes et inexpliquées. Séparez au moins ces trois rôles :

Rôle de la référenceCe qu’elle doit contrôlerCe qu’elle ne doit pas contrôler
Référence de compositionNombre de sujets, position, échelle relative, caméra, cadrage et espace négatifPalette, matière, coup de pinceau ou style d’éclairage
Référence du sujetIdentité, forme et détails distinctifs d’une personne ou d’un objetComposition générale ou objets de fond sans rapport
Référence de stylePalette, texture, qualité du trait, grain, éclairage et langage de renduObjets, texte ou composition présents dans cette image

Si la tâche ne nécessite que la composition et le style, limitez-vous à ces deux images. Ajouter des références ne donne pas automatiquement davantage de contrôle ; cela peut aussi introduire des signaux concurrents que le système devra concilier.

Pourquoi une liste plate produit souvent un compromis générique

Une liste plate indique seulement que « toutes ces images comptent », sans préciser le rôle de chacune. Le modèle ou l’agent intermédiaire doit deviner leur relation. Il peut reprendre la couleur d’une image, la texture d’une autre et un objet indésirable d’une troisième, puis générer un compromis visuellement plausible mais éloigné de l’objectif.

Cette défaillance ne provoque pas forcément d’erreur structurelle. L’authentification, l’envoi des fichiers, la syntaxe de la requête et l’analyse de la réponse peuvent tous fonctionner. Un statut HTTP de réussite ou un message « generation completed » ne peut donc pas servir de validation visuelle. Le processus doit inclure un contrôle de la composition après la génération.

Étape 1 : rédigez un contrat de rôle pour chaque référence

Avant d’allonger le prompt, répondez à quatre questions pour chaque image :

  1. Que faut-il impérativement préserver ? Par exemple : le sujet reste en bas à gauche, la partie supérieure demeure libre pour un titre et l’angle de caméra reste bas.
  2. Que faut-il ignorer ? Par exemple : ne reprenez ni l’identité de la personne, ni le texte de marque, ni l’architecture d’arrière-plan de la référence de style.
  3. Quelle est la rigidité de la règle ? La composition est-elle une contrainte ferme et la couleur une préférence, ou l’inverse ?
  4. Qui l’emporte en cas de conflit ? Par exemple : pour la position des objets, la référence de composition prime sur les indications implicites de l’image de style.

Un contrat exploitable peut prendre cette forme :

FichierRôlePréserverIgnorerRègle en cas de conflit
layout.pngCompositionDeux sujets avec rapport grand-petit, espace libre à droite, vue en plongéeCouleur et matièreSes relations spatiales priment sur toutes les autres références
subject.pngSujetSilhouette et détails distinctifsArrière-plan et caméra d’origineRemplacer le sujet sans le déplacer dans la composition
style.pngStylePalette gris chaud, grain papier, ombres doucesPersonnes et texte de l’imageTransférer uniquement l’apparence, pas le contenu

C’est plus utile que « référence 1, 2 et 3 », car le contrat définit à la fois les signaux recherchés et les transferts interdits.

Étape 2 : remplacez la liste plate par une requête hiérarchisée

Les champs exacts d’une API varient selon l’outil. L’exemple ci-dessous est une structure conceptuelle, et non le contrat réel d’un fournisseur. Utilisez-le pour vérifier que l’agent conserve les rôles jusqu’à la requête finale :

references:
  - id: layout
    source: layout.png
    role: composition
    preserve: [subject_count, position, scale, camera, negative_space]
  - id: subject
    source: subject.png
    role: identity
    preserve: [shape, distinctive_details]
  - id: style
    source: style.png
    role: appearance
    preserve: [palette, texture, line_quality, lighting]
    exclude: [objects, text, composition]
priority:
  - layout
  - subject
  - style
acceptance_reference: layout.png

La question importante n’est pas de savoir si votre API emploie ces noms de champs. Il faut vérifier que la même information traverse toute la chaîne. Inspectez la requête réellement envoyée par l’agent : le tableau d’images a-t-il été transformé en une chaîne concaténée ? Les descriptions de rôles ont-elles été noyées dans du texte libre ? Une relance ou un traitement par lot a-t-il changé l’ordre des fichiers ?

Si l’API cible documente des types de références distincts, des pondérations ou des masques d’édition, transposez le contrat de rôles dans ce schéma. Si elle ne le permet pas, n’inventez pas de paramètres. Passez à un processus en plusieurs étapes.

Étape 3 : travaillez en deux phases si l’outil ne sait pas exprimer les rôles

Si l’interface n’accepte qu’un ensemble indifférencié d’images, verrouillez d’abord la composition, puis appliquez le style. Deux transformations séparées sont généralement plus faciles à diagnostiquer qu’une seule requête chargée de tous les signaux.

Phase A : établir la composition et le sujet

Utilisez la référence de composition, puis ajoutez celle du sujet uniquement si nécessaire. Décrivez le nombre de sujets, leur position, la caméra, le cadrage et l’espace négatif. Laissez de côté les matières et le langage de rendu. L’objectif est d’obtenir une image structurellement correcte, même si elle paraît encore simple.

Phase B : appliquer l’apparence sans reconstruire la scène

Prenez le résultat de la phase A comme nouvelle base, puis modifiez-le ou redessinez-le avec la référence de style. Précisez que la position et les limites des sujets, la caméra, le cadrage et l’espace négatif doivent rester fixes ; seules la palette, la texture, la qualité du trait et la lumière peuvent changer.

Si l’outil accepte des masques, n’exposez que les zones à modifier. Sans mode d’édition, gardez l’image de la phase A comme référence principale et l’image de style comme référence secondaire. La disponibilité de pondérations explicites dépend de la documentation actuelle de l’outil.

Étape 4 : lancez quatre variantes contrôlées pour localiser le signal perdu

Évitez de modifier sans cesse une requête complexe. Conservez le prompt, les dimensions et les autres réglages contrôlables, puis générez quatre variantes :

TestEntréePoint à vérifier
ARéférence de composition seuleLe nombre de sujets, leurs positions, la caméra, le cadrage et l’espace négatif sont-ils préservés ?
BRéférence de style seuleQuels éléments de palette, de texture, de trait et de lumière sont réellement transférés ?
CComposition et style dans une liste plateLe résultat devient-il un compromis, une moyenne de styles ou importe-t-il du contenu indésirable ?
DComposition et style avec rôles et priorité explicitesChaque cible est-elle plus proche du résultat attendu que dans le test C ?

Il ne s’agit pas de décider si le modèle est « bon » ou « mauvais ». Ces variantes servent à déterminer si la rupture apparaît lors de l’interprétation d’une seule image, lors de la combinaison de plusieurs images ou dans la gestion des paramètres par l’agent. Si A et B fonctionnent, que C dérive et que D s’améliore, l’ambiguïté des rôles est une hypothèse solide. Si D ressemble à C, inspectez le payload final ou adoptez la méthode en deux phases.

Quand l’outil propose un seed, gardez-le constant entre les variantes pour réduire l’aléatoire. Dans le cas contraire, ne présentez pas la comparaison comme déterministe : générez plusieurs échantillons par variante et recherchez les défauts structurels récurrents.

Étape 5 : validez par rapport à la composition cible, pas parce que « c’est joli »

Le résultat dangereux n’est pas toujours laid. Il peut sembler suffisamment soigné pour passer une revue rapide tout en manquant la véritable structure du gabarit. Vérifiez les contraintes fermes avant de juger le style.

Contraintes fermes : rejetez le candidat dès qu’une seule est fausse

  • Le nombre de sujets est correct.
  • Leur position et leur échelle relative correspondent à la mise en page.
  • La direction de la caméra, le cadrage et le point de vue sont corrects.
  • L’espace réservé au texte ou l’espace négatif reste disponible.
  • Aucun objet, aucune personne et aucun texte de la référence de style ne s’est introduit dans le résultat.
  • Les caractéristiques distinctives du sujet restent reconnaissables.

Contraintes souples : utilisez-les pour classer les candidats restants

  • La palette est proche de la cible.
  • La texture et le grain semblent intentionnels plutôt que brouillons.
  • Les lignes, les contours et les ombres correspondent au langage visuel recherché.
  • Le résultat paraît cohérent au lieu d’être une moyenne de plusieurs styles.

Placez la référence de composition et chaque candidat côte à côte, puis notez réussite ou échec pour chaque contrainte ferme. Ne conservez pas seulement l’image finale : gardez aussi la version de la requête, l’ordre des références et le payload exact envoyé par l’agent. Ces éléments permettent de reproduire la prochaine dérive.

Diagnostiquez les symptômes courants dans le bon ordre

SymptômePremier point à contrôlerRéponse recommandée
Le style est fort, mais la composition changeL’image de style a-t-elle été traitée comme une référence principale équivalente ?Renforcer la priorité du layout ou séparer composition et style en deux phases
La composition est correcte, mais le style est faibleLe prompt ne contient-il que des mots d’ambiance abstraits ?Nommer des propriétés visibles de palette, matière, trait et lumière
Plusieurs styles se fondent en un rendu génériqueDes références de style contradictoires sont-elles utilisées ensemble ?Choisir un style dominant et attribuer aux autres un seul trait précis
Le sujet de l’image de style apparaît dans le résultatAvez-vous indiqué que seule l’apparence devait être transférée ?Exclure explicitement ses objets, son texte et sa composition
Les modifications du prompt restent sans effetL’agent a-t-il réellement envoyé les nouveaux paramètres ?Comparer les payloads finaux, pas seulement le formulaire en amont
L’API réussit, mais les images continuent de dériverLe statut technique sert-il de validation visuelle ?Ajouter des critères fermes de composition et des comparaisons contrôlées

Un processus minimal à réutiliser

  1. Ne sélectionnez que les références nécessaires à la tâche.
  2. Attribuez à chaque image un rôle principal, avec des règles de préservation, d’exclusion et de conflit.
  3. Inspectez la requête finale pour confirmer que les tableaux, l’ordre et les rôles n’ont pas été aplatis.
  4. Lancez des bases de référence composition seule et style seul avant de comparer la liste plate à la version structurée.
  5. Rejetez les candidats sur les contraintes fermes de composition avant de comparer le style.
  6. Conservez ensemble les candidats, les références, les versions de requête et les résultats de validation.
  7. Si l’interface ne peut pas exprimer les rôles, traitez d’abord la composition, puis le style.

L’objectif n’est pas d’allonger le prompt. Il s’agit de créer un processus dans lequel chaque signal visuel a un responsable. Tant que vous pouvez répondre à « quelle image contrôle cet attribut, quelle règle l’emporte en cas de conflit et qu’est-ce qu’un résultat valide ? », plusieurs références ne sont plus un tas d’images que le modèle doit interpréter seul.

Prêt à optimiser votre workflow LLM ?

Connectez vos modèles via une API unique, gérez les clés et maîtrisez vos dépenses d’IA.

Commencer gratuitement