Middle — Senior
Waarom 80/10/10 bij het maskeren van BERT (masker, willekeurig, origineel)?
sobes.tech AI
Antwoord van AI
In de pre-training van BERT wordt een maskeringsstrategie voor tokens gebruikt om het model te trainen om verborgen woorden te voorspellen. De 80/10/10-regel betekent dat, van alle geselecteerde tokens voor masking:
- 80% wordt vervangen door een speciaal token [MASK], zodat het model leert om precies de gemaskeerde woorden te voorspellen.
- 10% wordt vervangen door willekeurige tokens, zodat het model niet overfit op het maskeringspatroon en leert resistent te zijn tegen ruis.
- 10% blijft ongewijzigd (originele tokens), zodat het model de context behoudt en niet te afhankelijk wordt van de aanwezigheid van [MASK].
Deze balans helpt het model beter te generaliseren en overfitting op kunstmatig gemaakte maskers te voorkomen.