Middle — Senior
Dlaczego 80/10/10 w maskowaniu BERT (maskowanie, losowe, oryginalne)?
sobes.tech AI
Odpowiedź od AI
Wstępne szkolenie BERT wykorzystuje strategię maskowania tokenów, aby nauczyć model przewidywania ukrytych słów. Zasada 80/10/10 oznacza, że spośród wszystkich wybranych do maskowania tokenów:
- 80% jest zastępowanych specjalnym tokenem [MASK], aby model nauczył się przewidywać dokładnie maskowane słowa.
- 10% jest zastępowanych losowymi tokenami, aby model nie był nadmiernie dopasowany do wzoru maskowania i nauczył się być odpornym na szum.
- 10% pozostaje bez zmian (oryginalne tokeny), aby model zachował kontekst i nie polegał zbyt mocno na obecności [MASK].
Taka równowaga pomaga modelowi lepiej uogólniać i unikać nadmiernego dopasowania do sztucznie tworzonych masek.