Cos'è Mask2Former e qual è il suo approccio basato sulle query?
sobes.tech AI
Risposta dell'AI
Mask2Former è un approccio moderno ai compiti di segmentazione delle immagini che combina diversi tipi di segmentazione (ad esempio, semantica, di istanza e panottica) in un'architettura unificata. L'idea principale è utilizzare un meccanismo basato su query, ispirato ai trasformatori, per prevedere le maschere degli oggetti.
Invece di un classificatore classico riga per riga o pixel per pixel, Mask2Former formula la segmentazione come un compito di ricerca di un insieme di maschere utilizzando un insieme di query apprendibili. Ogni query è responsabile della previsione di una maschera e della sua classe. Questo permette al modello di separare efficacemente oggetti e sfondo, oltre a gestire diversi tipi di segmentazione in un unico framework.
Funziona approssimativamente così:
- L'immagine di input passa attraverso un backbone (ad esempio, CNN o trasformatore) per estrarre le caratteristiche.
- Queste caratteristiche vengono inserite in un trasformatore, dove le query apprendibili interagiscono con le caratteristiche.
- L'output per ogni query è una maschera e una classe.
Questo approccio semplifica l'architettura e migliora la qualità della segmentazione grazie al contesto globale e alla flessibilità delle query.