Accueil / Factory / Algos ML / AutoML — factory / algos ML / automatisation du machine learning

AUTO ML.

Des outils qui testent automatiquement des dizaines d'algorithmes et de réglages sur vos données, les classent en validation croisée et combinent souvent les meilleurs. En quelques minutes, on obtient un modèle solide et une idée du niveau de performance atteignable. L'analyste ne disparaît pas : il prépare les données et lit le résultat d'un œil critique.

AutomatisationChoix de modèleRéglageDonnées tabulairesNiveau : débutant

FICHE D'IDENTITÉ

notes sur 5 · usage entreprise
PerformanceSouvent au niveau d'un bon modèle réglé à la main
InterprétabilitéLe gagnant est souvent un ensemble empilé, opaque
VitesseDe quelques minutes à quelques heures selon le budget fixé
Facilité de réglageQuasiment rien à régler : un budget de temps suffit
Tolérance aux données brutesEncodage et imputation en partie automatiques, pas le nettoyage
EN 30 SECONDES

Un concours de cuisine où l'on soumet le même panier d'ingrédients à 20 chefs, chacun avec sa recette. Un jury note chaque plat à l'aveugle, puis on sert le meilleur, ou un assortiment des meilleurs.

1. On fournit les données et la cible

Un tableau, la colonne à prédire, une métrique et un budget en temps ou en nombre de modèles.

2. La machine teste et règle

L'outil entraîne des modèles variés (régression régularisée, forêts, boosting, réseaux de neurones), explore leurs réglages et note chacun en validation croisée.

3. On lit le classement

Le classement (leaderboard) liste les modèles du meilleur au moins bon. Les ensembles empilés, qui combinent plusieurs modèles, arrivent souvent en tête.

LE CAS MÉTIER

premier modèle · churn télécom / énergie / assurance
EN ENTRÉE

Une base clients et une échéance

3 000 clients avec ancienneté, appels au support, montant mensuel, contrat, incidents récents, et le churn observé. La direction veut savoir en une journée si un score de départ est faisable, et à quel niveau de qualité.

EN SORTIE

Un classement de modèles

Chaque modèle testé apparaît avec son AUC en validation croisée, du GLM aux ensembles empilés. Le meilleur est prêt à scorer la base. Si un GLM simple est à quelques millièmes du premier, c'est lui qu'on met en production.

CE QU'ON MESURE

L'AUC sur un jeu de test resté à l'écart

Le classement est fait en validation croisée, sur les données d'entraînement. Le verdict se fait sur 30 % de clients mis de côté avant de lancer l'AutoML. Un écart important entre les deux signale un surapprentissage ou une fuite de données.

QUAND LE SORTIR, QUAND L'ÉVITER

OUI

  • Obtenir vite une référence de performance avant d'investir dans un projet
  • Équipe réduite qui doit livrer plusieurs modèles tabulaires
  • Comparer honnêtement de nombreux algorithmes sans biais de préférence
  • Industrialiser des modèles récurrents sur des données qui changent peu de structure

NON

  • Données mal préparées ou cible mal définie : l'AutoML optimise fidèlement un mauvais problème
  • Décision à justifier ligne à ligne : contraindre l'outil à des modèles lisibles, ou ajouter SHAP
  • Séries temporelles, textes, images : utiliser des outils spécialisés ou vérifier le découpage chronologique
  • Fuites de données (une variable connue seulement après l'événement) : l'AutoML les exploitera sans prévenir
LES 4 RÉGLAGES QUI COMPTENT

Noms donnés pour H2O, identiques en R et en Python. D'autres outils existent : auto-sklearn, FLAML, AutoGluon, ou les services AutoML des clouds.

Budget : max_runtime_secs / max_models

Le temps ou le nombre de modèles autorisés. Au-delà de quelques dizaines de modèles, le gain est en général faible.

Métrique de classement : sort_metric

AUC pour un score, logloss si les probabilités doivent être fiables, erreur absolue pour une prévision. Le classement suit ce critère.

Algorithmes autorisés : include_algos / exclude_algos

Pour exiger un modèle explicable, on peut limiter l'outil au GLM, ou au moins exclure les ensembles empilés, au prix d'un peu de performance.

Validation : nfolds

5 blocs par défaut (H2O peut passer à un simple jeu de validation sur de très gros volumes). Pour des données datées ou groupées par client, fournir soi-même la colonne de découpage (fold_column).

LE CODE MINIMAL

jeu d'exemple : clients_churn.csv ↓
# Score de churn : AutoML (H2O) en R
library(h2o)

h2o.init()                                         # démarre un serveur H2O local (Java requis)
clients <- h2o.importFile("clients_churn.csv")
clients$churn <- as.factor(clients$churn)          # classification, pas régression
parts <- h2o.splitFrame(clients, ratios = 0.7, seed = 42)
variables <- c("anciennete", "appels_support", "montant", "contrat", "incidents_3m")

# Au plus 20 modèles ou 10 minutes : GLM, forêts, boosting, deep learning, puis ensembles empilés
aml <- h2o.automl(x = variables, y = "churn", training_frame = parts[[1]],
                  max_models = 20, max_runtime_secs = 600, sort_metric = "AUC", seed = 42)

# Classement des modèles en validation croisée (5 blocs par défaut)
print(aml@leaderboard, n = 10)

# Verdict sur des clients jamais vus, pour le meilleur modèle
cat("Meilleur modèle :", aml@leader@model_id, "\n")
cat("AUC sur le jeu de test :", round(h2o.auc(h2o.performance(aml@leader, newdata = parts[[2]])), 3), "\n")

QUESTIONS FRÉQUENTES

Qu'est-ce que l'AutoML ?

L'AutoML (automated machine learning) désigne les outils qui automatisent tout ou partie de la construction d'un modèle : préparation simple des données, choix de l'algorithme, réglage des hyperparamètres, combinaison de modèles et évaluation. L'utilisateur fournit les données, la cible et un budget de calcul.

L'AutoML va-t-il remplacer les data scientists ?

Il remplace surtout la partie la plus répétitive : essayer des algorithmes et régler des paramètres. Formuler le problème, construire les bonnes variables, repérer les fuites de données, choisir la métrique et faire adopter le modèle restent des tâches humaines, et ce sont elles qui font la valeur d'un projet.

Quel outil d'AutoML choisir ?

H2O AutoML fonctionne en R et en Python et convient bien aux données tabulaires. AutoGluon et FLAML sont très performants en Python. Les clouds proposent leurs propres services (Vertex AI, Azure ML, SageMaker Autopilot). Le bon choix dépend surtout de votre environnement technique et de vos contraintes d'hébergement des données.

LES ALGOS VOISINS

à comparer avant de choisir
le moteur de réglage

Optimisation bayésienne

Méthode de réglage utilisée par plusieurs outils AutoML pour choisir les essais.

Voir la fiche →
le gagnant fréquent

Stacking

Combine les prédictions de plusieurs modèles par un modèle de second niveau. Souvent en tête du classement AutoML.

Voir la fiche →
pour ouvrir la boîte

SHAP

Explique, client par client, les prédictions du modèle retenu par l'AutoML.

Voir la fiche →
— formation

Passer de la fiche à la pratique

Dataistudio forme les équipes au machine learning et à l'IA, sur des cas concrets.

Voir les formations →