Accueil / Factory / Algos ML / Modèles de diffusion — factory / algos ML / modèles génératifs

MODÈLES DE DIFFUSION.

Un modèle de diffusion apprend à retirer du bruit d'une image. Une fois entraîné, on lui donne un bruit pur et il le nettoie pas à pas, guidé par une description écrite, jusqu'à obtenir une image nouvelle. C'est la technique derrière Stable Diffusion, DALL-E 3 ou Imagen, et une grande partie des générateurs de vidéo.

Génération d'imagesDeep learningTexte vers imageModèle pré-entraînéNiveau : avancé

FICHE D'IDENTITÉ

notes sur 5 · usage entreprise
PerformanceLa référence actuelle pour générer des images réalistes
InterprétabilitéDes centaines de millions de paramètres, aucune règle
VitessePlusieurs passes de débruitage, sauf modèles distillés
Facilité de réglageModèles prêts à l'emploi, mais la consigne demande du métier
Tolérance aux données brutesConsigne libre, résultat sensible à la formulation
EN 30 SECONDES

Un restaurateur de tableaux qui a passé des années à retirer la poussière de toiles. Donnez-lui une toile couverte d'une poussière uniforme en lui disant « un vase bleu sur une table » : il restaure un tableau qui n'a jamais existé.

1. On abîme des images volontairement

Pendant l'entraînement, on ajoute à des millions d'images un bruit aléatoire plus ou moins fort, jusqu'à les rendre méconnaissables.

2. Le réseau apprend à prédire le bruit

Pour chaque niveau de bruit, un réseau de neurones apprend à estimer le bruit ajouté, en tenant compte de la légende de l'image. Retirer ce bruit estimé rapproche de l'image propre.

3. On génère en partant du bruit pur

Pour créer, on part d'un bruit aléatoire et on répète le débruitage, guidé par la description. Stable Diffusion fait ce travail dans un espace compressé, bien plus rapide que les pixels.

LE CAS MÉTIER

visuels marketing · retail / e-commerce / agence
EN ENTRÉE

Un brief de visuel

Quelques mots : produit, décor, lumière, cadrage. Le modèle du code, SD-Turbo, comprend mieux les consignes rédigées en anglais.

EN SORTIE

Plusieurs propositions en quelques secondes

Le code produit quatre variantes du même brief, une par graine aléatoire, sur GPU. Le graphiste choisit, retouche ou relance avec une consigne corrigée.

CE QU'ON MESURE

La part de visuels retenus

Aucune métrique automatique ne juge un visuel marketing. On compte la part de propositions retenues par l'équipe créative et le temps gagné, et on vérifie licence, respect de la charte et absence de marques ou de personnes réelles.

QUAND LE SORTIR, QUAND L'ÉVITER

OUI

  • Maquettes, planches d'inspiration et variantes de visuels pour tester des idées
  • Décors et mises en scène de produits pour le e-commerce
  • Retouche ciblée : effacer, remplacer ou prolonger une zone d'image (inpainting)
  • Images synthétiques pour entraîner un modèle de vision, avec contrôle humain

NON

  • Photo de produit qui doit être exacte : le modèle invente des détails, logos et textes compris
  • Usage commercial sans avoir lu la licence du modèle et vérifié les droits
  • Gros volumes sans GPU : passer par une API ou un modèle distillé
  • Visuel montrant une personne réelle identifiable : risques juridiques
LES 4 RÉGLAGES QUI COMPTENT

Noms donnés pour la bibliothèque diffusers de Hugging Face.

num_inference_steps

Nombre d'étapes de débruitage : 20 à 50 pour un modèle classique, 1 à 4 pour un modèle distillé comme SD-Turbo. Plus d'étapes, plus de détails et plus de calcul.

guidance_scale

Force avec laquelle l'image suit la description. Autour de 7 pour Stable Diffusion classique ; 0 pour SD-Turbo, entraîné pour se passer de ce guidage. Trop fort, les images saturent.

negative_prompt

Ce qu'on ne veut pas voir : flou, texte, mains déformées. Il n'agit que si le guidage est activé.

generator (graine)

Fixe le bruit de départ. Même graine et même consigne donnent la même image : indispensable pour retrouver et décliner un visuel validé.

LE CODE MINIMAL

données simulées dans le code
# Visuels marketing : modèle de diffusion en Python
import torch
from diffusers import AutoPipelineForText2Image

# SD-Turbo : modèle public de Stability AI, distillé pour générer en 1 étape
appareil = "cuda" if torch.cuda.is_available() else "cpu"
precision = torch.float16 if appareil == "cuda" else torch.float32
pipe = AutoPipelineForText2Image.from_pretrained("stabilityai/sd-turbo", torch_dtype=precision)
pipe = pipe.to(appareil)

# Le brief, en anglais : langue dans laquelle le modèle a appris
brief = "product photo of a ceramic coffee mug on a wooden table, soft morning light, minimalist"

# Quatre variantes du même brief : une graine aléatoire par variante
for graine in range(4):
    generateur = torch.Generator(appareil).manual_seed(42 + graine)
    image = pipe(prompt=brief, num_inference_steps=1, guidance_scale=0.0, generator=generateur).images[0]
    image.save("visuel_" + str(graine) + ".png")
    print("Visuel", graine, "enregistré, taille :", image.size)

Les modèles de diffusion se pratiquent en Python (PyTorch, diffusers) : pas d'équivalent R courant.

QUESTIONS FRÉQUENTES

Comment fonctionne Stable Diffusion ?

Un autoencodeur compresse les images dans un espace plus petit. Un réseau de débruitage y apprend à retirer le bruit, guidé par la description passée dans un encodeur de texte de type CLIP. Pour générer, on débruite un bruit aléatoire dans cet espace, puis le décodeur le convertit en image.

Peut-on utiliser les images générées à des fins commerciales ?

Cela dépend de la licence du modèle ou du service, à lire à chaque fois. En France, la protection par le droit d'auteur d'une image produite sans apport créatif humain reste incertaine. Il faut aussi éviter de reproduire des marques, des œuvres ou des personnes réelles.

Pourquoi les images générées contiennent-elles du texte illisible ?

Le modèle produit des formes plausibles sans représentation fiable de l'orthographe. Les modèles récents progressent, mais pour un slogan ou un logo, on ajoute le texte après coup dans un outil de mise en page.

LES ALGOS VOISINS

à comparer avant de choisir
le prédécesseur

GAN

Génère en une seule passe, donc plus vite, mais avec moins de variété et un entraînement instable.

Voir la fiche →
la compression utilisée

VAE

Stable Diffusion débruite dans l'espace compressé d'un autoencodeur de cette famille, puis décode l'image.

Voir la fiche →
le lien avec le texte

CLIP (multimodal)

Un encodeur de texte de type CLIP traduit la consigne en vecteurs qui guident le débruitage.

Voir la fiche →
— formation

Passer de la fiche à la pratique

Dataistudio forme les équipes au machine learning et à l'IA, sur des cas concrets.

Voir les formations →