Un détecteur d'objets qui regarde l'image une seule fois et rend directement une boîte, une classe et une confiance pour chaque objet. Assez rapide pour traiter une vidéo en direct, YOLO sert à compter des personnes ou des véhicules, suivre des colis, vérifier des rayons ou le port d'équipements de sécurité.
Un agent de sécurité qui jette un seul coup d'œil à l'écran de surveillance et annonce : trois personnes, un bus, une voiture, avec leur position. Pas besoin de balayer l'image case par case.
L'image entière traverse un réseau convolutif une seule fois. Les anciennes méthodes examinaient des milliers de zones candidates une par une.
L'image est découpée en cases, à plusieurs échelles. Chaque case prédit les boîtes des objets dont le centre tombe chez elle, avec une classe et une confiance.
Plusieurs cases voient souvent le même objet. Un filtre (NMS) garde la boîte la plus sûre et supprime celles qui la recouvrent ; certaines versions récentes s'en passent.
Seuls les objets au-dessus du seuil de confiance (ici 50 %) sont conservés. On obtient une liste : classe, confiance, coordonnées de la boîte.
Une photo de rue publique fournie par Ultralytics, avec un bus et des passants. En production : les images d'une caméra de parking, de magasin ou d'entrepôt, traitées en continu.
Pour chaque objet détecté : sa classe, sa confiance et sa position. Le métier lit le comptage par classe : personnes par heure, véhicules en file, colis sur un convoyeur.
Une détection est juste si sa boîte recouvre assez la vraie boîte. La mAP combine précision et rappel sur toutes les classes et plusieurs seuils de recouvrement. En exploitation, on suit surtout l'erreur de comptage sur des séquences vérifiées à la main.
Noms donnés pour la bibliothèque Ultralytics (Python).
Du plus léger (n) au plus lourd (x) : yolo11n pour l'embarqué et le CPU, s ou m pour la plupart des projets, l ou x quand la précision prime sur la vitesse.
Le seuil de confiance. Plus haut : moins de fausses détections, plus d'oublis. À régler sur des images vérifiées, selon le coût de chaque erreur.
La taille à laquelle l'image est redimensionnée (640 par défaut). L'augmenter aide pour les petits objets, au prix de la vitesse.
Pour vos propres objets : quelques centaines d'images annotées en boîtes, un fichier de configuration, et un réentraînement qui part des poids pré-entraînés.
# Comptage de véhicules et de piétons : YOLO en Python (Ultralytics)
from collections import Counter
from ultralytics import YOLO
# Modèle public YOLO11n (le plus petit), pré-entraîné sur COCO : 80 classes (personne, voiture, bus...)
modele = YOLO("yolo11n.pt")
# Image d'exemple publique d'Ultralytics : une rue avec un bus et des passants
resultats = modele.predict("https://ultralytics.com/images/bus.jpg", conf=0.5)
boites = resultats[0].boxes
# Une ligne par objet : classe, confiance, coordonnées de la boîte en pixels
for classe, score, coords in zip(boites.cls.tolist(), boites.conf.tolist(), boites.xyxy.tolist()):
print(f"{modele.names[int(classe)]:8s} confiance {score:.2f} boîte {[round(c) for c in coords]}")
# Le comptage par classe, ce que lit le métier
print(Counter(modele.names[int(c)] for c in boites.cls.tolist()))
# Pour vos propres objets : réentraîner sur vos images annotées au format YOLO
# modele.train(data="mes_objets.yaml", epochs=50, imgsz=640)
YOLO se pratique en Python (Ultralytics, PyTorch) : pas d'usage R courant en entreprise.
You Only Look Once : le réseau ne regarde l'image qu'une fois pour trouver tous les objets. La première version a été publiée en 2015 par Joseph Redmon. Les versions récentes les plus utilisées sont développées par la société Ultralytics.
Le code Ultralytics est sous licence AGPL-3.0 : on peut l'utiliser gratuitement, mais un logiciel qui l'intègre doit alors être publié sous la même licence. Pour un produit fermé, il faut une licence entreprise payante. D'autres détecteurs existent sous licences plus permissives.
En partant des poids pré-entraînés, quelques centaines d'images annotées par classe donnent souvent un premier modèle utilisable. La variété compte plus que le volume : angles, éclairages, arrière-plans et tailles d'objets doivent ressembler aux conditions réelles.
Le réseau convolutif qui extrait les motifs de l'image. YOLO y ajoute la prédiction des boîtes.
Voir la fiche → détourer plutôt qu'encadrerDonne le contour exact de chaque zone, pixel par pixel. Annotation plus coûteuse.
Voir la fiche → pour vos objetsRepartir d'un YOLO pré-entraîné et l'adapter avec quelques centaines d'images annotées.
Voir la fiche →Dataistudio forme les équipes au machine learning et à l'IA, sur des cas concrets.
Nous utilisons des cookies de mesure d'audience et de suivi publicitaire pour comprendre la fréquentation du site et l'efficacité de nos annonces. Rien n'est déposé sans votre accord. En savoir plus