Middle — Senior
Miért 80/10/10 a BERT maszkolásban (maszk, véletlenszerű, eredeti)?
sobes.tech MI
Válasz az MI-től
A BERT előképzésében tokenmaszkolási stratégiát alkalmaznak a modell tanítására, hogy előre jelezze a rejtett szavakat. Az 80/10/10 szabály azt jelenti, hogy a maszkolásra kiválasztott összes token közül:
- 80%-át egy speciális [MASK] tokenre cserélik, hogy a modell megtanulja pontosan előre jelezni a maszkolt szavakat.
- 10%-át véletlenszerű tokenekre cserélik, hogy a modell ne tanuljon túl a maszkolási mintán, és rezisztens legyen a zajra.
- 10%-a változatlan marad (eredeti tokenek), hogy a modell megőrizze a kontextust, és ne támaszkodjon túlzottan a [MASK] jelenlétére.
Ez az egyensúly segít a modellnek jobban általánosítani és elkerülni a mesterségesen létrehozott maszkokon való túlzott tanulást.