Sobes.tech
Middle — Senior

Mi az a masked autoencoders (MAE) a CV-hez?

sobes.tech MI

Válasz az MI-től

Maszkos automatikus kódolók (MAE) a számítógépes látásban olyan típusú modellek, amelyek megtanulják rekonstruálni egy kép rejtett (maszkos) részét a látható rész alapján. Az ötlet az, hogy véletlenszerűen maszkolt (elrejtett) részekkel ellátott képet adnak bemenetként, és a modell feladata ezeket a maszkolt részeket rekonstruálni.

Ez segít a modellnek megérteni a kép szerkezetét és kontextusát anélkül, hogy címkékre lenne szükség. A MAE-k gyakran használnak transzformátorokat, amelyek jól működnek képrészletek sorozataival.

Példa:

  • A képet részekre osztják (pl. 16x16 pixel).
  • A részek nagy részét véletlenszerűen kiválasztják maszkolásra (pl. 75%).
  • A modell csak a nem maszkolt részeket kapja, és meg kell jósolnia a maszkolt részek pixeleit.

Ez a megközelítés hatékony az önfelügyelt módon történő képreprezentációk tanítására, ami javítja a későbbi osztályozási vagy más CV feladatokat.