Accueil / Factory / Algos ML / Régression logistique — factory / algos ML / apprentissage supervisé

RÉGRESSION LOGISTIQUE.

Une régression qui prédit une probabilité plutôt qu'un chiffre : risque de départ, de défaut, d'achat. Chaque variable reçoit un coefficient qui se traduit en « cote multipliée par tant ». C'est la référence du scoring en banque et en assurance, parce que chaque score se justifie devant un client ou un régulateur.

ClassificationScoringDonnées tabulairesModèle interprétableNiveau : débutant

FICHE D'IDENTITÉ

notes sur 5 · usage entreprise
PerformanceSolide référence, battue quand les effets se croisent
InterprétabilitéChaque coefficient se lit comme un cote multipliée
VitesseEntraînement en secondes, score instantané
Facilité de réglagePresque rien à régler, le travail porte sur les variables
Tolérance aux données brutesValeurs manquantes à traiter, sensible aux extrêmes
EN 30 SECONDES

Une grille de points : tant de points par appel au support, tant de points en moins par mois d'ancienneté. On additionne, puis une courbe en S transforme le total en probabilité.

1. On additionne des points

Comme en régression linéaire, chaque variable reçoit un poids. La somme pondérée donne un score sans limite, positif ou négatif.

2. On convertit le score en probabilité

La fonction logistique, une courbe en S, ramène ce score entre 0 et 1. Un score nul donne 50 %, un score très positif s'approche de 100 %.

3. On cherche les poids les plus vraisemblables

L'algorithme ajuste les poids pour que les clients partis reçoivent des probabilités hautes et les fidèles des probabilités basses. C'est le maximum de vraisemblance.

LE CAS MÉTIER

churn · télécom / énergie / assurance
EN ENTRÉE

Une ligne par client

Ancienneté, nombre d'appels au support, montant mensuel, type de contrat, incidents des 3 derniers mois. Et la colonne à prédire : le client est-il parti ?

EN SORTIE

Un score et ses raisons

Chaque client reçoit une probabilité de départ. Les odds ratios expliquent pourquoi : sur le jeu d'exemple, un contrat mensuel multiplie la cote de départ par plus de 2 par rapport à un contrat annuel, et chaque appel au support par environ 1,5.

CE QU'ON MESURE

L'AUC pour classer, les probabilités pour décider

L'AUC vérifie que les partants reçoivent un score plus haut que les fidèles : 0,5 correspond au hasard, 1 à la perfection (ici entre 0,75 et 0,80). Les probabilités étant en général bien calibrées, on peut aussi chiffrer le gain attendu d'une campagne de rétention.

QUAND LE SORTIR, QUAND L'ÉVITER

OUI

  • Décision à justifier ligne à ligne : crédit, assurance, RH, secteur réglementé
  • Besoin de probabilités fiables pour chiffrer un coût ou un gain attendu
  • Premier modèle de référence sur un problème oui / non
  • Score à recoder simplement dans un outil métier ou un tableur

NON

  • Effets à seuil ou croisés entre variables : un arbre ou une Random Forest les trouve seuls
  • Recherche de la performance maximale : tester XGBoost ou une Random Forest
  • Variables très corrélées entre elles : les coefficients deviennent instables, ajouter une régularisation
  • Données brutes avec manquants et extrêmes : un modèle à base d'arbres est plus tolérant
LES 4 RÉGLAGES QUI COMPTENT

Peu de paramètres, mais chacun change la lecture du modèle. Noms donnés pour R (glm) et Python (scikit-learn).

Régularisation : glmnet / C

scikit-learn freine les coefficients par défaut (pénalité L2, C = 1). Plus C est petit, plus le frein est fort. glm() n'en applique aucune, il faut glmnet en R. Sur quelques milliers de lignes, l'écart reste faible.

Mise à l'échelle : scale / StandardScaler

Sans mise à l'échelle, un odds ratio se lit par unité : par mois, par euro. Avec StandardScaler dans un Pipeline, il se lit par écart-type : les variables deviennent comparables et la pénalité les traite à égalité.

Modalité de référence

Les coefficients d'une variable catégorielle se lisent par rapport à une modalité de base, ici le contrat annuel. En R, relevel() permet d'en changer.

Seuil de décision

Le modèle donne une probabilité, pas une décision. Le seuil de 50 % n'a rien d'obligatoire : on le fixe selon le coût d'une action de rétention et la valeur d'un client conservé.

LE CODE MINIMAL

jeu d'exemple : clients_churn.csv ↓
# Churn clients : régression logistique en R
clients <- read.csv("clients_churn.csv")
clients$contrat <- factor(clients$contrat)   # référence : annuel

set.seed(42)
idx <- sample(nrow(clients), round(0.7 * nrow(clients)))
train <- clients[idx, ]
test <- clients[-idx, ]

modele <- glm(churn ~ anciennete + appels_support + montant + contrat + incidents_3m,
              data = train, family = binomial)

# Odds ratios et intervalles à 95 % : facteur multiplicatif sur la cote de départ
print(round(exp(cbind(OR = coef(modele), confint.default(modele)))[-1, ], 3))

# Score de départ sur les clients jamais vus
proba <- predict(modele, newdata = test, type = "response")

# AUC calculée en R base (formule des rangs)
rangs <- rank(proba)
n1 <- sum(test$churn == 1)
n0 <- sum(test$churn == 0)
auc <- (sum(rangs[test$churn == 1]) - n1 * (n1 + 1) / 2) / (n1 * n0)
cat("AUC test :", round(auc, 3), "\n")

QUESTIONS FRÉQUENTES

Comment interpréter un odds ratio ?

Un odds ratio de 1,5 pour les appels au support signifie que chaque appel supplémentaire multiplie la cote de départ par 1,5, les autres variables étant fixes. La cote est la probabilité de partir divisée par la probabilité de rester. Au-dessus de 1, le risque augmente, en dessous il baisse. C'est la cote qui est multipliée, pas la probabilité.

Pourquoi parler de régression pour un problème de classification ?

Le modèle fait bien une régression : il estime un score continu, le logarithme de la cote, comme une somme pondérée des variables. La classification n'intervient qu'à la fin, quand on applique un seuil à la probabilité obtenue.

Régression logistique ou Random Forest pour un score de churn ?

La Random Forest gagne souvent quelques points d'AUC, car elle capte seule les seuils et les interactions. La régression logistique reste préférable quand il faut expliquer chaque score, documenter le modèle pour un régulateur ou le recoder dans un outil métier.

LES ALGOS VOISINS

à comparer avant de choisir
souvent plus précise

Random Forest

Des centaines d'arbres qui votent. Capte seule les seuils et les interactions, mais ne se lit pas ligne à ligne.

Voir la fiche →
le format bancaire

Scorecard crédit

Une régression logistique dont les variables sont découpées en tranches et les coefficients convertis en points.

Voir la fiche →
l'autre modèle lisible

Arbre de décision (CART)

Des règles si / alors au lieu de coefficients. Plus parlant pour le terrain, moins stable.

Voir la fiche →
— formation

Passer de la fiche à la pratique

Dataistudio forme les équipes au machine learning et à l'IA, sur des cas concrets.

Voir les formations →