Sobes.tech
Middle — Senior

Miks 80/10/10 BERT-maskeerimisel (mask, juhuslik, algupärane)?

sobes.tech AI

Vastus AI-lt

BERT-i eelõppimisel kasutatakse tokenite maskeerimise strateegiat, et treenida mudelit varjama peidetud sõnu. Reegel 80/10/10 tähendab, et kõigist maskimiseks valitud tokenitest:

  • 80% asendatakse spetsiaalse tokeniga [MASK], et mudel õpiks täpselt prognoosima maskeeritud sõnu.
  • 10% asendatakse juhuslike tokenitega, et mudel ei üleõpiks maskimise mustrile ja õpiks olema vastupidav mürarele.
  • 10% jääb muutumatuks (originaalsed tokenid), et mudel säilitaks konteksti ja ei sõltuks liiga palju [MASK]-i olemasolust.

See tasakaal aitab mudelil paremini üldistada ja vältida kunstlikult loodud maskide üleõppimist.