Un grand modèle de langage (LLM) prédit le token suivant d'un texte, puis le suivant, et ainsi de suite. Entraîné sur d'immenses volumes de textes, il rédige, résume, traduit ou extrait une information à partir d'une simple consigne. C'est le moteur de ChatGPT, Claude ou Gemini.
La saisie semi-automatique de votre téléphone, entraînée sur des milliers de milliards de mots et capable de tenir compte de pages entières de contexte avant de proposer la suite.
Le modèle lit d'immenses volumes de texte et apprend à prédire le token suivant, un token étant un morceau de mot. Pour bien prédire, il doit capter la grammaire, des faits et des raisonnements courants.
On le réentraîne sur des exemples de demandes et de bonnes réponses, puis sur des préférences humaines (RLHF). Il devient un assistant qui suit des consignes.
À chaque pas, le modèle calcule une probabilité pour chaque token de son vocabulaire, en choisit un, l'ajoute au texte et recommence. La température règle la part de hasard dans ce choix.
Des avis clients courts, en français. Le LLM reçoit une consigne écrite : rôle, ton attendu, longueur, et ce qu'il ne doit pas promettre.
Le conseiller relit, corrige et envoie. Le code affiche aussi les trois tokens que le modèle juge les plus probables pour commencer sa réponse : tout le mécanisme, vu de près.
L'équipe relit un échantillon et classe chaque brouillon : accepté tel quel, corrigé ou rejeté. On surveille surtout les promesses non autorisées, comme un remboursement ou un geste commercial.
Pas d'entraînement : le travail porte sur la consigne et les paramètres de génération. Noms donnés pour transformers de Hugging Face.
Rôle, ton, format, interdits. C'est le levier principal. Ajouter deux ou trois exemples de bonnes réponses rend le résultat nettement plus régulier.
Sans échantillonnage, le modèle prend toujours le token le plus probable : réponses stables et reproductibles. Avec une température plus haute, il varie davantage : utile pour des idées, risqué pour des faits.
Longueur maximale de la réponse, en tokens. Elle borne le coût et évite les réponses fleuves.
Un petit modèle ouvert tourne sur un serveur interne ; un grand modèle via API rédige mieux mais coûte plus cher par token. On teste le plus petit qui suffit.
# Réponses aux avis clients : LLM génératif en Python
import pandas as pd
import torch
from transformers import AutoTokenizer, AutoModelForCausalLM
avis = pd.read_csv("avis_clients.csv")
negatifs = avis[avis["sentiment"] == "negatif"].head(3)
nom = "Qwen/Qwen2.5-0.5B-Instruct" # petit LLM public et multilingue, tourne sur CPU
tokenizer = AutoTokenizer.from_pretrained(nom)
modele = AutoModelForCausalLM.from_pretrained(nom)
consigne = "Vous êtes conseiller client. Répondez en 2 phrases, sans promettre de remboursement."
for texte in negatifs["texte"]:
messages = [{"role": "system", "content": consigne}, {"role": "user", "content": "Avis : " + texte}]
entree = tokenizer.apply_chat_template(messages, add_generation_prompt=True, return_dict=True, return_tensors="pt")
# Le mécanisme : une probabilité pour chaque token du vocabulaire
with torch.no_grad():
proba = torch.softmax(modele(**entree).logits[0, -1], dim=-1)
top = torch.topk(proba, 3)
print("Premiers tokens probables :", [(tokenizer.decode(int(i)), round(p.item(), 2)) for p, i in zip(top.values, top.indices)])
# La génération répète ce choix, token après token
sortie = modele.generate(**entree, max_new_tokens=80, do_sample=False)
n = entree["input_ids"].shape[1]
print(texte, "->", tokenizer.decode(sortie[0, n:], skip_special_tokens=True), "\n")
Les LLM se pratiquent en Python (transformers) ou par API : en R, le package ellmer permet d'interroger un LLM par API, sans en faire tourner un localement.
Large Language Model, grand modèle de langage. C'est un réseau de neurones de type Transformer, entraîné sur d'énormes volumes de texte à prédire le token suivant. GPT, Claude, Gemini, Llama ou Mistral sont des LLM.
Il produit la suite la plus plausible, pas la plus vraie. Sans source fiable dans son contexte, il comble les trous avec du texte vraisemblable : on parle d'hallucination. Le RAG, qui lui fournit vos documents, réduit ce risque sans le supprimer.
GPT (Generative Pre-trained Transformer) désigne la famille de modèles d'OpenAI. ChatGPT est l'application de conversation construite dessus, avec des modèles affinés pour suivre des consignes et dialoguer.
Le mécanisme d'attention qui permet au modèle de tenir compte de tout le contexte avant de prédire.
Voir la fiche → pour répondre sur vos sourcesOn fournit au LLM les passages utiles de vos documents : il répond à partir d'eux et les cite.
Voir la fiche → pour le spécialiserOn réentraîne une petite partie du modèle sur vos exemples pour fixer un style ou une tâche.
Voir la fiche →Dataistudio forme les équipes au machine learning et à l'IA, sur des cas concrets.
Nous utilisons des cookies de mesure d'audience et de suivi publicitaire pour comprendre la fréquentation du site et l'efficacité de nos annonces. Rien n'est déposé sans votre accord. En savoir plus