Sobes.tech
Middle — Senior

Mi az a Mask2Former és mi a kérdésalapú megközelítése?

sobes.tech MI

Válasz az MI-től

Mask2Former egy modern megközelítés a képek szegmentálási feladataihoz, amely különböző szegmentálási típusokat (például szemantikus, példány- és panoptikus) egyesít egy egységes architektúrában. A fő ötlet egy query-alapú mechanizmus használata, amelyet a transzformátorok ihlettek, az objektummaszkok előrejelzéséhez.

A klasszikus sor- vagy pixelalapú osztályozó helyett a Mask2Former a szegmentálást egy olyan feladatként fogalmazza meg, amelyben egy tanulható kérdésekből álló halmaz segítségével keres egy maszkokból álló halmazt. Minden kérdés felelős egy maszk és annak osztályának előrejelzéséért. Ez lehetővé teszi a modell számára, hogy hatékonyan különítse el az objektumokat és a hátteret, valamint különböző szegmentálási típusokat kezeljen egy keretben.

Kb. így működik:

  • A bemeneti kép átmegy egy backbone-en (például CNN vagy transzformátor), hogy jellemzőket nyerjen ki.
  • Ezek a jellemzők bemegynek egy transzformátorba, ahol a tanulható kérdések kölcsönhatásba lépnek a jellemzőkkel.
  • Minden kérdéshez tartozik egy maszk és egy osztály.

Ez a megközelítés egyszerűsíti az architektúrát, és javítja a szegmentálás minőségét a globális kontextus és a kérdések rugalmassága révén.