Sobes.tech
Middle — Senior

Dlaczego 80/10/10 w maskowaniu BERT (maskowanie, losowe, oryginalne)?

sobes.tech AI

Odpowiedź od AI

Wstępne szkolenie BERT wykorzystuje strategię maskowania tokenów, aby nauczyć model przewidywania ukrytych słów. Zasada 80/10/10 oznacza, że spośród wszystkich wybranych do maskowania tokenów:

  • 80% jest zastępowanych specjalnym tokenem [MASK], aby model nauczył się przewidywać dokładnie maskowane słowa.
  • 10% jest zastępowanych losowymi tokenami, aby model nie był nadmiernie dopasowany do wzoru maskowania i nauczył się być odpornym na szum.
  • 10% pozostaje bez zmian (oryginalne tokeny), aby model zachował kontekst i nie polegał zbyt mocno na obecności [MASK].

Taka równowaga pomaga modelowi lepiej uogólniać i unikać nadmiernego dopasowania do sztucznie tworzonych masek.