Was ist Mask2Former und was ist sein query-basiertes Ansatz?
sobes.tech KI
Antwort von AI
Mask2Former ist ein moderner Ansatz für Bildsegmentierungsaufgaben, der verschiedene Segmentierungstypen (z. B. semantisch, instanzbasiert und panoptisch) in einer einheitlichen Architektur vereint. Die Hauptidee ist die Verwendung eines query-basierten Mechanismus, inspiriert von Transformatoren, um Masken von Objekten vorherzusagen.
Anstelle eines klassischen Zeilen- oder Pixelklassifikators formuliert Mask2Former die Segmentierung als eine Aufgabe der Suche nach einer Menge von Masken unter Verwendung einer Menge lernbarer Anfragen. Jede Anfrage ist verantwortlich für die Vorhersage einer Maske und ihrer Klasse. Dies ermöglicht es dem Modell, Objekte und Hintergrund effizient zu trennen sowie verschiedene Segmentierungstypen in einem Rahmen zu verarbeiten.
Es funktioniert ungefähr so:
- Das Eingabebild wird durch ein Backbone (z. B. CNN oder Transformator) geleitet, um Merkmale zu extrahieren.
- Diese Merkmale werden in einen Transformator eingespeist, in dem lernbare Anfragen mit den Merkmalen interagieren.
- Die Ausgabe für jede Anfrage ist eine Maske und eine Klasse.
Dieser Ansatz vereinfacht die Architektur und verbessert die Segmentierungsqualität durch den globalen Kontext und die Flexibilität der Anfragen.