Middle — Senior
Mi az a masked autoencoders (MAE) a CV-hez?
sobes.tech MI
Válasz az MI-től
Maszkos automatikus kódolók (MAE) a számítógépes látásban olyan típusú modellek, amelyek megtanulják rekonstruálni egy kép rejtett (maszkos) részét a látható rész alapján. Az ötlet az, hogy véletlenszerűen maszkolt (elrejtett) részekkel ellátott képet adnak bemenetként, és a modell feladata ezeket a maszkolt részeket rekonstruálni.
Ez segít a modellnek megérteni a kép szerkezetét és kontextusát anélkül, hogy címkékre lenne szükség. A MAE-k gyakran használnak transzformátorokat, amelyek jól működnek képrészletek sorozataival.
Példa:
- A képet részekre osztják (pl. 16x16 pixel).
- A részek nagy részét véletlenszerűen kiválasztják maszkolásra (pl. 75%).
- A modell csak a nem maszkolt részeket kapja, és meg kell jósolnia a maszkolt részek pixeleit.
Ez a megközelítés hatékony az önfelügyelt módon történő képreprezentációk tanítására, ami javítja a későbbi osztályozási vagy más CV feladatokat.