L'architecture de réseau de neurones publiée par Google en 2017 dans l'article « Attention Is All You Need ». Elle lit une séquence entière d'un coup grâce à l'attention, au lieu de la lire mot après mot. BERT, GPT, Claude, Mistral et les modèles de vision récents en dérivent tous.
Au lieu de lire un contrat ligne après ligne en retenant ce qu'il peut, le lecteur étale toutes les pages sur une table et relie d'un coup d'œil chaque clause à celles qui la concernent.
Le texte est découpé en jetons (des mots ou morceaux de mots), chacun traduit en vecteur. On y ajoute un codage de la position, car l'attention seule ignore l'ordre.
Chaque couche laisse chaque jeton regarder tous les autres (attention multi-têtes), puis passe le résultat dans un petit réseau. On empile des dizaines de couches : le sens s'affine à chaque étage.
Un encodeur (type BERT) produit une représentation pour classer ou extraire. Un décodeur (type GPT) prédit le jeton suivant pour générer du texte. Les deux ensemble servent à traduire ou résumer.
Des avis en texte libre, et quatre destinations possibles : livraison, qualité du produit, service client, prix. Aucun avis n'a été étiqueté à la main.
Un Transformer pré-entraîné compare chaque avis à la phrase « Cet avis parle de livraison », puis des autres services, et donne un score à chacun. C'est la classification zéro-shot : aucun exemple n'est nécessaire au départ.
On étiquette à la main 100 à 200 avis pour mesurer la part bien routée par service. On fixe ensuite un seuil de score : en dessous, l'avis part vers un humain. Les avis qui mêlent plusieurs sujets demandent l'option multi-étiquette (multi_label=True).
En entreprise, on n'entraîne presque jamais un Transformer de zéro : on choisit un modèle et une façon de l'utiliser.
Encodeur (BERT, CamemBERT) pour classer, extraire, rechercher. Décodeur (GPT, Llama, Mistral) pour générer. Encodeur-décodeur (T5) pour traduire ou résumer.
Un modèle de quelques centaines de millions de paramètres tourne sur un serveur classique. Au-delà de quelques milliards, il faut des GPU ou une API. Tester d'abord le plus petit qui convient.
Zéro-shot ou consigne (prompt) pour démarrer, fine-tuning quand on dispose d'exemples, RAG quand le modèle doit s'appuyer sur vos documents.
Le nombre de jetons lus à la fois. Au-delà, le texte est tronqué. Découper les documents longs en morceaux.
# Routage des avis clients : Transformer (classification zéro-shot) en Python
import pandas as pd
from transformers import pipeline
avis = pd.read_csv("avis_clients.csv").sample(20, random_state=42)
# Modèle public multilingue (mDeBERTa-v3, environ 280 M de paramètres), entraîné
# à dire si une phrase en implique une autre : il sert ici sans aucun exemple étiqueté
classifieur = pipeline("zero-shot-classification", model="MoritzLaurer/mDeBERTa-v3-base-mnli-xnli")
services = ["livraison", "qualité du produit", "service client", "prix"]
resultats = classifieur(list(avis["texte"]), candidate_labels=services,
hypothesis_template="Cet avis parle de {}.")
# Service le plus probable pour chaque avis, avec son score
avis["service"] = [r["labels"][0] for r in resultats]
avis["score"] = [round(r["scores"][0], 2) for r in resultats]
print(avis[["texte", "service", "score"]].head(10).to_string(index=False))
print(avis["service"].value_counts())
Les Transformers se pratiquent en Python (transformers de Hugging Face, PyTorch) : pas d'équivalent R courant en entreprise.
Le Transformer est une architecture, un plan de construction. Un LLM (grand modèle de langage) est un modèle précis, bâti sur cette architecture et entraîné sur d'énormes volumes de texte. Presque tous les LLM actuels reposent sur des Transformers, mais un Transformer peut être petit et servir à tout autre chose.
Un RNN lit les mots un par un, ce qui empêche de paralléliser le calcul et fait oublier le début des longs textes. Le Transformer traite tous les mots en même temps grâce à l'attention. Il s'entraîne beaucoup plus vite sur GPU, ce qui a permis de passer à des modèles géants.
Oui pour l'usage d'un modèle de taille modeste : classer quelques milliers de textes avec un modèle de type BERT se fait sur un processeur classique, plus lentement. L'entraînement ou l'usage de grands modèles génératifs demande en pratique des GPU ou une API.
Le calcul qui permet à chaque jeton de regarder tous les autres. Le comprendre, c'est comprendre le Transformer.
Voir la fiche → la version encodeurUn Transformer entraîné à deviner des mots masqués. La référence pour classer et extraire de l'information.
Voir la fiche → la version décodeurDes Transformers entraînés à prédire le mot suivant, à très grande échelle. Ils rédigent, résument et raisonnent.
Voir la fiche →Dataistudio forme les équipes au machine learning et à l'IA, sur des cas concrets.
Nous utilisons des cookies de mesure d'audience et de suivi publicitaire pour comprendre la fréquentation du site et l'efficacité de nos annonces. Rien n'est déposé sans votre accord. En savoir plus