Middle — Senior
De ce 80/10/10 în mascarea BERT (mască, aleatoriu, original)?
sobes.tech AI
Răspuns de la AI
În pre-antrenamentul BERT, se utilizează o strategie de mascarea a tokenurilor pentru a antrena modelul să prezică cuvintele ascunse. Regula 80/10/10 înseamnă că, dintre toate tokenurile selectate pentru mascarea:
- 80% sunt înlocuite cu un token special [MASK], pentru ca modelul să învețe să prezică exact cuvintele mascate.
- 10% sunt înlocuite cu tokenuri aleatorii, pentru ca modelul să nu se supra-antreneze pe modelul de mascarea și să învețe să fie rezistent la zgomot.
- 10% rămân neschimbate (tokenuri originale), pentru ca modelul să păstreze contextul și să nu depindă prea mult de prezența [MASK].
Acest echilibru ajută modelul să generalizeze mai bine și să evite supraînvățarea pe măști artificiale.