Mi az a Mask2Former és mi a kérdésalapú megközelítése?
sobes.tech MI
Válasz az MI-től
Mask2Former egy modern megközelítés a képek szegmentálási feladataihoz, amely különböző szegmentálási típusokat (például szemantikus, példány- és panoptikus) egyesít egy egységes architektúrában. A fő ötlet egy query-alapú mechanizmus használata, amelyet a transzformátorok ihlettek, az objektummaszkok előrejelzéséhez.
A klasszikus sor- vagy pixelalapú osztályozó helyett a Mask2Former a szegmentálást egy olyan feladatként fogalmazza meg, amelyben egy tanulható kérdésekből álló halmaz segítségével keres egy maszkokból álló halmazt. Minden kérdés felelős egy maszk és annak osztályának előrejelzéséért. Ez lehetővé teszi a modell számára, hogy hatékonyan különítse el az objektumokat és a hátteret, valamint különböző szegmentálási típusokat kezeljen egy keretben.
Kb. így működik:
- A bemeneti kép átmegy egy backbone-en (például CNN vagy transzformátor), hogy jellemzőket nyerjen ki.
- Ezek a jellemzők bemegynek egy transzformátorba, ahol a tanulható kérdések kölcsönhatásba lépnek a jellemzőkkel.
- Minden kérdéshez tartozik egy maszk és egy osztály.
Ez a megközelítés egyszerűsíti az architektúrát, és javítja a szegmentálás minőségét a globális kontextus és a kérdések rugalmassága révén.