Accueil / Factory / Algos ML / Transformer — factory / algos ML / architecture de réseaux de neurones

ARCHITECTURE TRANSFORMER.

L'architecture de réseau de neurones publiée par Google en 2017 dans l'article « Attention Is All You Need ». Elle lit une séquence entière d'un coup grâce à l'attention, au lieu de la lire mot après mot. BERT, GPT, Claude, Mistral et les modèles de vision récents en dérivent tous.

ArchitectureTexteLLMDeep learningModèles pré-entraînésNiveau : avancé

FICHE D'IDENTITÉ

notes sur 5 · usage entreprise
PerformanceL'état de l'art en texte, et très fort en image et en son
InterprétabilitéDes centaines de millions de paramètres, aucune règle lisible
VitesseRapide à entraîner en parallèle, mais lourd sans GPU
Facilité de réglageSimple en réutilisant un modèle, très difficile à entraîner
Tolérance aux données brutesPrend le texte brut, découpé en jetons, sans préparation
EN 30 SECONDES

Au lieu de lire un contrat ligne après ligne en retenant ce qu'il peut, le lecteur étale toutes les pages sur une table et relie d'un coup d'œil chaque clause à celles qui la concernent.

1. Le texte devient une suite de vecteurs

Le texte est découpé en jetons (des mots ou morceaux de mots), chacun traduit en vecteur. On y ajoute un codage de la position, car l'attention seule ignore l'ordre.

2. Des couches d'attention s'empilent

Chaque couche laisse chaque jeton regarder tous les autres (attention multi-têtes), puis passe le résultat dans un petit réseau. On empile des dizaines de couches : le sens s'affine à chaque étage.

3. Une tête adaptée à la tâche

Un encodeur (type BERT) produit une représentation pour classer ou extraire. Un décodeur (type GPT) prédit le jeton suivant pour générer du texte. Les deux ensemble servent à traduire ou résumer.

LE CAS MÉTIER

routage de réclamations · e-commerce / service client
EN ENTRÉE

Des avis clients et une liste de services

Des avis en texte libre, et quatre destinations possibles : livraison, qualité du produit, service client, prix. Aucun avis n'a été étiqueté à la main.

EN SORTIE

Un service et un score par avis

Un Transformer pré-entraîné compare chaque avis à la phrase « Cet avis parle de livraison », puis des autres services, et donne un score à chacun. C'est la classification zéro-shot : aucun exemple n'est nécessaire au départ.

CE QU'ON MESURE

Exactitude sur un échantillon relu

On étiquette à la main 100 à 200 avis pour mesurer la part bien routée par service. On fixe ensuite un seuil de score : en dessous, l'avis part vers un humain. Les avis qui mêlent plusieurs sujets demandent l'option multi-étiquette (multi_label=True).

QUAND LE SORTIR, QUAND L'ÉVITER

OUI

  • Texte, traduction, résumé, extraction, question-réponse : l'architecture de référence
  • Démarrer sans données étiquetées grâce à un modèle pré-entraîné (zéro-shot)
  • Ajuster un modèle existant sur quelques milliers d'exemples métier (fine-tuning)
  • Contextes longs où des éléments éloignés doivent être reliés

NON

  • Données tabulaires : XGBoost ou LightGBM restent la référence
  • Millions de textes à classer à coût minimal : TF-IDF et régression logistique suffisent souvent
  • Décision à justifier ligne à ligne : un modèle lisible ou une règle métier
  • Données confidentielles et aucun serveur interne : attention aux modèles hébergés par un tiers
LES CHOIX QUI COMPTENT

En entreprise, on n'entraîne presque jamais un Transformer de zéro : on choisit un modèle et une façon de l'utiliser.

Type de modèle

Encodeur (BERT, CamemBERT) pour classer, extraire, rechercher. Décodeur (GPT, Llama, Mistral) pour générer. Encodeur-décodeur (T5) pour traduire ou résumer.

Taille du modèle

Un modèle de quelques centaines de millions de paramètres tourne sur un serveur classique. Au-delà de quelques milliards, il faut des GPU ou une API. Tester d'abord le plus petit qui convient.

Mode d'usage

Zéro-shot ou consigne (prompt) pour démarrer, fine-tuning quand on dispose d'exemples, RAG quand le modèle doit s'appuyer sur vos documents.

Longueur de contexte : max_length

Le nombre de jetons lus à la fois. Au-delà, le texte est tronqué. Découper les documents longs en morceaux.

LE CODE MINIMAL

jeu d'exemple : avis_clients.csv ↓
# Routage des avis clients : Transformer (classification zéro-shot) en Python
import pandas as pd
from transformers import pipeline

avis = pd.read_csv("avis_clients.csv").sample(20, random_state=42)

# Modèle public multilingue (mDeBERTa-v3, environ 280 M de paramètres), entraîné
# à dire si une phrase en implique une autre : il sert ici sans aucun exemple étiqueté
classifieur = pipeline("zero-shot-classification", model="MoritzLaurer/mDeBERTa-v3-base-mnli-xnli")

services = ["livraison", "qualité du produit", "service client", "prix"]
resultats = classifieur(list(avis["texte"]), candidate_labels=services,
                        hypothesis_template="Cet avis parle de {}.")

# Service le plus probable pour chaque avis, avec son score
avis["service"] = [r["labels"][0] for r in resultats]
avis["score"] = [round(r["scores"][0], 2) for r in resultats]
print(avis[["texte", "service", "score"]].head(10).to_string(index=False))
print(avis["service"].value_counts())

Les Transformers se pratiquent en Python (transformers de Hugging Face, PyTorch) : pas d'équivalent R courant en entreprise.

QUESTIONS FRÉQUENTES

Quelle différence entre Transformer et LLM ?

Le Transformer est une architecture, un plan de construction. Un LLM (grand modèle de langage) est un modèle précis, bâti sur cette architecture et entraîné sur d'énormes volumes de texte. Presque tous les LLM actuels reposent sur des Transformers, mais un Transformer peut être petit et servir à tout autre chose.

Pourquoi les Transformers ont-ils remplacé les RNN et LSTM ?

Un RNN lit les mots un par un, ce qui empêche de paralléliser le calcul et fait oublier le début des longs textes. Le Transformer traite tous les mots en même temps grâce à l'attention. Il s'entraîne beaucoup plus vite sur GPU, ce qui a permis de passer à des modèles géants.

Peut-on utiliser un Transformer sans GPU ?

Oui pour l'usage d'un modèle de taille modeste : classer quelques milliers de textes avec un modèle de type BERT se fait sur un processeur classique, plus lentement. L'entraînement ou l'usage de grands modèles génératifs demande en pratique des GPU ou une API.

LES ALGOS VOISINS

à comparer avant de choisir
la brique centrale

Mécanisme d'attention

Le calcul qui permet à chaque jeton de regarder tous les autres. Le comprendre, c'est comprendre le Transformer.

Voir la fiche →
la version encodeur

BERT

Un Transformer entraîné à deviner des mots masqués. La référence pour classer et extraire de l'information.

Voir la fiche →
la version décodeur

GPT et LLM

Des Transformers entraînés à prédire le mot suivant, à très grande échelle. Ils rédigent, résument et raisonnent.

Voir la fiche →
— formation

Passer de la fiche à la pratique

Dataistudio forme les équipes au machine learning et à l'IA, sur des cas concrets.

Voir les formations →