Sobes.tech
Middle — Senior

Proč 80/10/10 v maskování BERT (maska, náhodná, originální)?

sobes.tech AI

Odpověď od AI

Při předtréninku BERT se používá strategie maskování tokenů, která má za cíl naučit model předpovídat skryté slovo. Pravidlo 80/10/10 znamená, že ze všech tokenů určených k maskování:

  • 80 % je nahrazeno speciálním tokenem [MASK], aby se model naučil přesně předpovídat maskovaná slova.
  • 10 % je nahrazeno náhodnými tokeny, aby se model nepřeškolil na vzor maskování a naučil se být odolný vůči šumu.
  • 10 % zůstává nezměněno (původní tokeny), aby model zachoval kontext a příliš nespoléhal na přítomnost [MASK].

Tato rovnováha pomáhá modelu lépe generalizovat a vyhýbat se přeučení na uměle vytvořených maskách.