Middle — Senior
Proč 80/10/10 v maskování BERT (maska, náhodná, originální)?
sobes.tech AI
Odpověď od AI
Při předtréninku BERT se používá strategie maskování tokenů, která má za cíl naučit model předpovídat skryté slovo. Pravidlo 80/10/10 znamená, že ze všech tokenů určených k maskování:
- 80 % je nahrazeno speciálním tokenem [MASK], aby se model naučil přesně předpovídat maskovaná slova.
- 10 % je nahrazeno náhodnými tokeny, aby se model nepřeškolil na vzor maskování a naučil se být odolný vůči šumu.
- 10 % zůstává nezměněno (původní tokeny), aby model zachoval kontext a příliš nespoléhal na přítomnost [MASK].
Tato rovnováha pomáhá modelu lépe generalizovat a vyhýbat se přeučení na uměle vytvořených maskách.