Un modèle de diffusion apprend à retirer du bruit d'une image. Une fois entraîné, on lui donne un bruit pur et il le nettoie pas à pas, guidé par une description écrite, jusqu'à obtenir une image nouvelle. C'est la technique derrière Stable Diffusion, DALL-E 3 ou Imagen, et une grande partie des générateurs de vidéo.
Un restaurateur de tableaux qui a passé des années à retirer la poussière de toiles. Donnez-lui une toile couverte d'une poussière uniforme en lui disant « un vase bleu sur une table » : il restaure un tableau qui n'a jamais existé.
Pendant l'entraînement, on ajoute à des millions d'images un bruit aléatoire plus ou moins fort, jusqu'à les rendre méconnaissables.
Pour chaque niveau de bruit, un réseau de neurones apprend à estimer le bruit ajouté, en tenant compte de la légende de l'image. Retirer ce bruit estimé rapproche de l'image propre.
Pour créer, on part d'un bruit aléatoire et on répète le débruitage, guidé par la description. Stable Diffusion fait ce travail dans un espace compressé, bien plus rapide que les pixels.
Quelques mots : produit, décor, lumière, cadrage. Le modèle du code, SD-Turbo, comprend mieux les consignes rédigées en anglais.
Le code produit quatre variantes du même brief, une par graine aléatoire, sur GPU. Le graphiste choisit, retouche ou relance avec une consigne corrigée.
Aucune métrique automatique ne juge un visuel marketing. On compte la part de propositions retenues par l'équipe créative et le temps gagné, et on vérifie licence, respect de la charte et absence de marques ou de personnes réelles.
Noms donnés pour la bibliothèque diffusers de Hugging Face.
Nombre d'étapes de débruitage : 20 à 50 pour un modèle classique, 1 à 4 pour un modèle distillé comme SD-Turbo. Plus d'étapes, plus de détails et plus de calcul.
Force avec laquelle l'image suit la description. Autour de 7 pour Stable Diffusion classique ; 0 pour SD-Turbo, entraîné pour se passer de ce guidage. Trop fort, les images saturent.
Ce qu'on ne veut pas voir : flou, texte, mains déformées. Il n'agit que si le guidage est activé.
Fixe le bruit de départ. Même graine et même consigne donnent la même image : indispensable pour retrouver et décliner un visuel validé.
# Visuels marketing : modèle de diffusion en Python
import torch
from diffusers import AutoPipelineForText2Image
# SD-Turbo : modèle public de Stability AI, distillé pour générer en 1 étape
appareil = "cuda" if torch.cuda.is_available() else "cpu"
precision = torch.float16 if appareil == "cuda" else torch.float32
pipe = AutoPipelineForText2Image.from_pretrained("stabilityai/sd-turbo", torch_dtype=precision)
pipe = pipe.to(appareil)
# Le brief, en anglais : langue dans laquelle le modèle a appris
brief = "product photo of a ceramic coffee mug on a wooden table, soft morning light, minimalist"
# Quatre variantes du même brief : une graine aléatoire par variante
for graine in range(4):
generateur = torch.Generator(appareil).manual_seed(42 + graine)
image = pipe(prompt=brief, num_inference_steps=1, guidance_scale=0.0, generator=generateur).images[0]
image.save("visuel_" + str(graine) + ".png")
print("Visuel", graine, "enregistré, taille :", image.size)
Les modèles de diffusion se pratiquent en Python (PyTorch, diffusers) : pas d'équivalent R courant.
Un autoencodeur compresse les images dans un espace plus petit. Un réseau de débruitage y apprend à retirer le bruit, guidé par la description passée dans un encodeur de texte de type CLIP. Pour générer, on débruite un bruit aléatoire dans cet espace, puis le décodeur le convertit en image.
Cela dépend de la licence du modèle ou du service, à lire à chaque fois. En France, la protection par le droit d'auteur d'une image produite sans apport créatif humain reste incertaine. Il faut aussi éviter de reproduire des marques, des œuvres ou des personnes réelles.
Le modèle produit des formes plausibles sans représentation fiable de l'orthographe. Les modèles récents progressent, mais pour un slogan ou un logo, on ajoute le texte après coup dans un outil de mise en page.
Génère en une seule passe, donc plus vite, mais avec moins de variété et un entraînement instable.
Voir la fiche → la compression utiliséeStable Diffusion débruite dans l'espace compressé d'un autoencodeur de cette famille, puis décode l'image.
Voir la fiche → le lien avec le texteUn encodeur de texte de type CLIP traduit la consigne en vecteurs qui guident le débruitage.
Voir la fiche →Dataistudio forme les équipes au machine learning et à l'IA, sur des cas concrets.
Nous utilisons des cookies de mesure d'audience et de suivi publicitaire pour comprendre la fréquentation du site et l'efficacité de nos annonces. Rien n'est déposé sans votre accord. En savoir plus