Accueil / Factory / Algos ML / YOLO — factory / algos ML / vision par ordinateur

DÉTECTION YOLO.

Un détecteur d'objets qui regarde l'image une seule fois et rend directement une boîte, une classe et une confiance pour chaque objet. Assez rapide pour traiter une vidéo en direct, YOLO sert à compter des personnes ou des véhicules, suivre des colis, vérifier des rayons ou le port d'équipements de sécurité.

ImagesDétection d'objetsTemps réelDeep learningNiveau : avancé

FICHE D'IDENTITÉ

notes sur 5 · usage entreprise
PerformanceTrès bon compromis précision et vitesse
InterprétabilitéBoîtes et confiances se vérifient à l'œil
VitesseTemps réel sur GPU, utilisable sur CPU et en embarqué
Facilité de réglageModèles pré-entraînés prêts ; réentraînement guidé
Tolérance aux données brutesPetits objets et scènes très denses plus difficiles
EN 30 SECONDES

Un agent de sécurité qui jette un seul coup d'œil à l'écran de surveillance et annonce : trois personnes, un bus, une voiture, avec leur position. Pas besoin de balayer l'image case par case.

1. Un seul passage dans le réseau

L'image entière traverse un réseau convolutif une seule fois. Les anciennes méthodes examinaient des milliers de zones candidates une par une.

2. Une grille de prédictions

L'image est découpée en cases, à plusieurs échelles. Chaque case prédit les boîtes des objets dont le centre tombe chez elle, avec une classe et une confiance.

3. On nettoie les doublons

Plusieurs cases voient souvent le même objet. Un filtre (NMS) garde la boîte la plus sûre et supprime celles qui la recouvrent ; certaines versions récentes s'en passent.

4. On garde les détections sûres

Seuls les objets au-dessus du seuil de confiance (ici 50 %) sont conservés. On obtient une liste : classe, confiance, coordonnées de la boîte.

LE CAS MÉTIER

ville et commerce · comptage de flux / sécurité / logistique
EN ENTRÉE

Une image ou un flux vidéo

Une photo de rue publique fournie par Ultralytics, avec un bus et des passants. En production : les images d'une caméra de parking, de magasin ou d'entrepôt, traitées en continu.

EN SORTIE

Une boîte par objet, puis un comptage

Pour chaque objet détecté : sa classe, sa confiance et sa position. Le métier lit le comptage par classe : personnes par heure, véhicules en file, colis sur un convoyeur.

CE QU'ON MESURE

La précision moyenne (mAP)

Une détection est juste si sa boîte recouvre assez la vraie boîte. La mAP combine précision et rappel sur toutes les classes et plusieurs seuils de recouvrement. En exploitation, on suit surtout l'erreur de comptage sur des séquences vérifiées à la main.

QUAND LE SORTIR, QUAND L'ÉVITER

OUI

  • Compter, localiser ou suivre des objets dans des images ou des vidéos
  • Besoin de temps réel : flux caméra, contrôle sur ligne de production
  • Objets courants (personnes, véhicules, animaux) : les modèles pré-entraînés marchent directement
  • Objets spécifiques avec quelques centaines d'images annotées en boîtes

NON

  • Contour exact ou surface d'un objet : c'est de la segmentation, voir U-Net
  • Une seule question sur l'image entière (défaut ou non) : un classifieur suffit
  • Usage commercial sans vérifier la licence : la bibliothèque Ultralytics est sous AGPL-3.0, une licence entreprise est nécessaire pour un produit fermé
  • Personnes identifiables sur les images : cadrer d'abord le traitement au regard du RGPD
LES 4 RÉGLAGES QUI COMPTENT

Noms donnés pour la bibliothèque Ultralytics (Python).

Taille du modèle

Du plus léger (n) au plus lourd (x) : yolo11n pour l'embarqué et le CPU, s ou m pour la plupart des projets, l ou x quand la précision prime sur la vitesse.

conf

Le seuil de confiance. Plus haut : moins de fausses détections, plus d'oublis. À régler sur des images vérifiées, selon le coût de chaque erreur.

imgsz

La taille à laquelle l'image est redimensionnée (640 par défaut). L'augmenter aide pour les petits objets, au prix de la vitesse.

Réentraînement (train)

Pour vos propres objets : quelques centaines d'images annotées en boîtes, un fichier de configuration, et un réentraînement qui part des poids pré-entraînés.

LE CODE MINIMAL

données simulées dans le code
# Comptage de véhicules et de piétons : YOLO en Python (Ultralytics)
from collections import Counter
from ultralytics import YOLO

# Modèle public YOLO11n (le plus petit), pré-entraîné sur COCO : 80 classes (personne, voiture, bus...)
modele = YOLO("yolo11n.pt")
# Image d'exemple publique d'Ultralytics : une rue avec un bus et des passants
resultats = modele.predict("https://ultralytics.com/images/bus.jpg", conf=0.5)
boites = resultats[0].boxes

# Une ligne par objet : classe, confiance, coordonnées de la boîte en pixels
for classe, score, coords in zip(boites.cls.tolist(), boites.conf.tolist(), boites.xyxy.tolist()):
    print(f"{modele.names[int(classe)]:8s} confiance {score:.2f}  boîte {[round(c) for c in coords]}")

# Le comptage par classe, ce que lit le métier
print(Counter(modele.names[int(c)] for c in boites.cls.tolist()))

# Pour vos propres objets : réentraîner sur vos images annotées au format YOLO
# modele.train(data="mes_objets.yaml", epochs=50, imgsz=640)

YOLO se pratique en Python (Ultralytics, PyTorch) : pas d'usage R courant en entreprise.

QUESTIONS FRÉQUENTES

Que signifie YOLO ?

You Only Look Once : le réseau ne regarde l'image qu'une fois pour trouver tous les objets. La première version a été publiée en 2015 par Joseph Redmon. Les versions récentes les plus utilisées sont développées par la société Ultralytics.

YOLO est-il gratuit pour un usage commercial ?

Le code Ultralytics est sous licence AGPL-3.0 : on peut l'utiliser gratuitement, mais un logiciel qui l'intègre doit alors être publié sous la même licence. Pour un produit fermé, il faut une licence entreprise payante. D'autres détecteurs existent sous licences plus permissives.

Combien d'images faut-il pour entraîner YOLO sur ses propres objets ?

En partant des poids pré-entraînés, quelques centaines d'images annotées par classe donnent souvent un premier modèle utilisable. La variété compte plus que le volume : angles, éclairages, arrière-plans et tailles d'objets doivent ressembler aux conditions réelles.

LES ALGOS VOISINS

à comparer avant de choisir
la brique de base

CNN

Le réseau convolutif qui extrait les motifs de l'image. YOLO y ajoute la prédiction des boîtes.

Voir la fiche →
détourer plutôt qu'encadrer

U-Net

Donne le contour exact de chaque zone, pixel par pixel. Annotation plus coûteuse.

Voir la fiche →
pour vos objets

Apprentissage par transfert

Repartir d'un YOLO pré-entraîné et l'adapter avec quelques centaines d'images annotées.

Voir la fiche →
— formation

Passer de la fiche à la pratique

Dataistudio forme les équipes au machine learning et à l'IA, sur des cas concrets.

Voir les formations →