Accueil / Factory / Algos ML / GPT et LLM — factory / algos ML / modèles de langage génératifs

GPT ET LLM.

Un grand modèle de langage (LLM) prédit le token suivant d'un texte, puis le suivant, et ainsi de suite. Entraîné sur d'immenses volumes de textes, il rédige, résume, traduit ou extrait une information à partir d'une simple consigne. C'est le moteur de ChatGPT, Claude ou Gemini.

Génération de texteTransformerModèle pré-entraînéService clientNiveau : intermédiaire

FICHE D'IDENTITÉ

notes sur 5 · usage entreprise
PerformancePolyvalent sans entraînement, mais peut inventer des faits
InterprétabilitéDes milliards de paramètres, raisonnement non vérifiable
VitesseQuelques secondes par réponse, coût facturé au token
Facilité de réglagePas d'entraînement : on règle la consigne et la génération
Tolérance aux données brutesLit le texte tel quel, fautes et formats variés compris
EN 30 SECONDES

La saisie semi-automatique de votre téléphone, entraînée sur des milliers de milliards de mots et capable de tenir compte de pages entières de contexte avant de proposer la suite.

1. Pré-entraînement : deviner la suite

Le modèle lit d'immenses volumes de texte et apprend à prédire le token suivant, un token étant un morceau de mot. Pour bien prédire, il doit capter la grammaire, des faits et des raisonnements courants.

2. Affinage : apprendre à répondre

On le réentraîne sur des exemples de demandes et de bonnes réponses, puis sur des préférences humaines (RLHF). Il devient un assistant qui suit des consignes.

3. Génération : un token à la fois

À chaque pas, le modèle calcule une probabilité pour chaque token de son vocabulaire, en choisit un, l'ajoute au texte et recommence. La température règle la part de hasard dans ce choix.

LE CAS MÉTIER

service client · e-commerce / distribution
EN ENTRÉE

Les avis négatifs de la semaine

Des avis clients courts, en français. Le LLM reçoit une consigne écrite : rôle, ton attendu, longueur, et ce qu'il ne doit pas promettre.

EN SORTIE

Un brouillon de réponse par avis

Le conseiller relit, corrige et envoie. Le code affiche aussi les trois tokens que le modèle juge les plus probables pour commencer sa réponse : tout le mécanisme, vu de près.

CE QU'ON MESURE

La part de brouillons envoyés sans retouche

L'équipe relit un échantillon et classe chaque brouillon : accepté tel quel, corrigé ou rejeté. On surveille surtout les promesses non autorisées, comme un remboursement ou un geste commercial.

QUAND LE SORTIR, QUAND L'ÉVITER

OUI

  • Rédiger des premiers jets : réponses clients, fiches produits, comptes rendus
  • Résumer ou extraire des informations de textes libres, sans données annotées
  • Prototyper en quelques jours un usage qui demandait auparavant un projet de plusieurs mois
  • Tâches où une relecture humaine reste prévue

NON

  • Faits ou chiffres à garantir : le modèle peut inventer, brancher un RAG sur vos sources
  • Classer des millions de textes à faible coût : un BERT affiné est plus économique
  • Calculs exacts : faire appeler un outil par le modèle (voir Agents LLM) ou coder le calcul
  • Données confidentielles vers une API externe sans cadre contractuel : préférer un modèle hébergé en interne
LES 4 RÉGLAGES QUI COMPTENT

Pas d'entraînement : le travail porte sur la consigne et les paramètres de génération. Noms donnés pour transformers de Hugging Face.

Consigne système

Rôle, ton, format, interdits. C'est le levier principal. Ajouter deux ou trois exemples de bonnes réponses rend le résultat nettement plus régulier.

do_sample / temperature

Sans échantillonnage, le modèle prend toujours le token le plus probable : réponses stables et reproductibles. Avec une température plus haute, il varie davantage : utile pour des idées, risqué pour des faits.

max_new_tokens

Longueur maximale de la réponse, en tokens. Elle borne le coût et évite les réponses fleuves.

Taille du modèle

Un petit modèle ouvert tourne sur un serveur interne ; un grand modèle via API rédige mieux mais coûte plus cher par token. On teste le plus petit qui suffit.

LE CODE MINIMAL

jeu d'exemple : avis_clients.csv ↓
# Réponses aux avis clients : LLM génératif en Python
import pandas as pd
import torch
from transformers import AutoTokenizer, AutoModelForCausalLM

avis = pd.read_csv("avis_clients.csv")
negatifs = avis[avis["sentiment"] == "negatif"].head(3)

nom = "Qwen/Qwen2.5-0.5B-Instruct"  # petit LLM public et multilingue, tourne sur CPU
tokenizer = AutoTokenizer.from_pretrained(nom)
modele = AutoModelForCausalLM.from_pretrained(nom)
consigne = "Vous êtes conseiller client. Répondez en 2 phrases, sans promettre de remboursement."

for texte in negatifs["texte"]:
    messages = [{"role": "system", "content": consigne}, {"role": "user", "content": "Avis : " + texte}]
    entree = tokenizer.apply_chat_template(messages, add_generation_prompt=True, return_dict=True, return_tensors="pt")
    # Le mécanisme : une probabilité pour chaque token du vocabulaire
    with torch.no_grad():
        proba = torch.softmax(modele(**entree).logits[0, -1], dim=-1)
    top = torch.topk(proba, 3)
    print("Premiers tokens probables :", [(tokenizer.decode(int(i)), round(p.item(), 2)) for p, i in zip(top.values, top.indices)])
    # La génération répète ce choix, token après token
    sortie = modele.generate(**entree, max_new_tokens=80, do_sample=False)
    n = entree["input_ids"].shape[1]
    print(texte, "->", tokenizer.decode(sortie[0, n:], skip_special_tokens=True), "\n")

Les LLM se pratiquent en Python (transformers) ou par API : en R, le package ellmer permet d'interroger un LLM par API, sans en faire tourner un localement.

QUESTIONS FRÉQUENTES

Que veut dire LLM ?

Large Language Model, grand modèle de langage. C'est un réseau de neurones de type Transformer, entraîné sur d'énormes volumes de texte à prédire le token suivant. GPT, Claude, Gemini, Llama ou Mistral sont des LLM.

Pourquoi un LLM invente-t-il parfois des informations ?

Il produit la suite la plus plausible, pas la plus vraie. Sans source fiable dans son contexte, il comble les trous avec du texte vraisemblable : on parle d'hallucination. Le RAG, qui lui fournit vos documents, réduit ce risque sans le supprimer.

Quelle différence entre GPT et ChatGPT ?

GPT (Generative Pre-trained Transformer) désigne la famille de modèles d'OpenAI. ChatGPT est l'application de conversation construite dessus, avec des modèles affinés pour suivre des consignes et dialoguer.

LES ALGOS VOISINS

à comparer avant de choisir
l'architecture

Transformer

Le mécanisme d'attention qui permet au modèle de tenir compte de tout le contexte avant de prédire.

Voir la fiche →
pour répondre sur vos sources

RAG

On fournit au LLM les passages utiles de vos documents : il répond à partir d'eux et les cite.

Voir la fiche →
pour le spécialiser

Fine-tuning et LoRA

On réentraîne une petite partie du modèle sur vos exemples pour fixer un style ou une tâche.

Voir la fiche →
— formation

Passer de la fiche à la pratique

Dataistudio forme les équipes au machine learning et à l'IA, sur des cas concrets.

Voir les formations →