Middle — Senior
Miks 80/10/10 BERT-maskeerimisel (mask, juhuslik, algupärane)?
sobes.tech AI
Vastus AI-lt
BERT-i eelõppimisel kasutatakse tokenite maskeerimise strateegiat, et treenida mudelit varjama peidetud sõnu. Reegel 80/10/10 tähendab, et kõigist maskimiseks valitud tokenitest:
- 80% asendatakse spetsiaalse tokeniga [MASK], et mudel õpiks täpselt prognoosima maskeeritud sõnu.
- 10% asendatakse juhuslike tokenitega, et mudel ei üleõpiks maskimise mustrile ja õpiks olema vastupidav mürarele.
- 10% jääb muutumatuks (originaalsed tokenid), et mudel säilitaks konteksti ja ei sõltuks liiga palju [MASK]-i olemasolust.
See tasakaal aitab mudelil paremini üldistada ja vältida kunstlikult loodud maskide üleõppimist.