Senior
Comment fonctionne le matching de la boîte englobante dans les modèles YOLO et DETR?
sobes.tech IA
Réponse de l'IA
Dans les modèles de détection d’objets, tels que YOLO et DETR, l’appariement des boîtes englobantes (bounding box) est le processus de faire correspondre les prédictions avec les vérités terrain (ground truth) pour l’entraînement et l’évaluation.
YOLO :
- Utilise une grille prédéfinie et des boîtes d’ancrage (anchor).
- Pour chaque boîte d’ancrage, la vérité terrain avec le IoU (Intersection over Union) maximal est sélectionnée.
- L’appariement est basé sur un seuil de IoU : si le IoU entre la boîte prédite et la vérité terrain est supérieur au seuil, elles sont considérées comme appariées.
- Cela permet au modèle d’apprendre à prédire correctement les coordonnées et les classes des objets.
DETR :
- Utilise un transformateur et un ensemble de prédictions sans ancrages.
- L’appariement se fait via l’algorithme hongrois.
- Pour chaque paire (prédiction, vérité terrain), un coût est calculé en tenant compte de :
- La distance entre les coordonnées des boîtes (par exemple, perte L1)
- IoU (ou IoU généralisé)
- L’erreur de classe
- L’algorithme hongrois trouve la correspondance optimale qui minimise le coût total.
- Cette approche permet d’associer efficacement les prédictions aux objets, même si leur nombre diffère.
Ainsi, YOLO repose sur des règles strictes et des ancrages, tandis que DETR utilise un algorithme d’optimisation pour un appariement dynamique sans ancrages.