Sobes.tech
Middle — Senior

Waarom 80/10/10 bij het maskeren van BERT (masker, willekeurig, origineel)?

sobes.tech AI

Antwoord van AI

In de pre-training van BERT wordt een maskeringsstrategie voor tokens gebruikt om het model te trainen om verborgen woorden te voorspellen. De 80/10/10-regel betekent dat, van alle geselecteerde tokens voor masking:

  • 80% wordt vervangen door een speciaal token [MASK], zodat het model leert om precies de gemaskeerde woorden te voorspellen.
  • 10% wordt vervangen door willekeurige tokens, zodat het model niet overfit op het maskeringspatroon en leert resistent te zijn tegen ruis.
  • 10% blijft ongewijzigd (originele tokens), zodat het model de context behoudt en niet te afhankelijk wordt van de aanwezigheid van [MASK].

Deze balans helpt het model beter te generaliseren en overfitting op kunstmatig gemaakte maskers te voorkomen.