Kas yra Mask2Former ir koks yra jo užklausomis pagrįstas požiūris?
sobes.tech AI
Atsakymas iš AI
Mask2Former yra šiuolaikinis požiūris į vaizdų segmentavimo užduotis, kuris sujungia įvairius segmentavimo tipus (pavyzdžiui, semantinį, instancijos ir panoptinį) vienoje architektūroje. Pagrindinė idėja yra naudoti query-based (užklausos pagrįstą) mechanizmą, įkvėptą transformatorių, prognozuojant objektų kaukes.
Vietoj klasikinio eilutės ar pikselio klasifikatoriaus, Mask2Former formuluoja segmentavimą kaip paieškos užduotį, naudojant mokomų užklausų rinkinį. Kiekviena užklausa atsakinga už vienos kaukės ir jos klasės prognozavimą. Tai leidžia modeliui efektyviai atskirti objektus nuo fono ir tvarkyti skirtingus segmentavimo tipus viename rėmelyje.
Maždaug taip veikia:
- Įvesties vaizdas praeina per backbone (pavyzdžiui, CNN ar transformatorių), kad išgautų ypatybes.
- Šios ypatybės įvedamos į transformatorių, kur mokomos užklausos sąveikauja su ypatybėmis.
- Kiekvienos užklausos išvestis yra kaukė ir klasė.
Šis požiūris supaprastina architektūrą ir pagerina segmentavimo kokybę dėl globalios konteksto ir užklausų lankstumo.