Middle — Senior
Prečo 80/10/10 v maskovaní BERT (maska, náhodná, originálna)?
sobes.tech AI
Odpoveď od AI
Pri predtreningu BERT-a uporablja se strategija maskiranja tokenov, da se model nauči napovedovati skrite besede. Pravilo 80/10/10 pomeni, da je od vseh izbranih tokenov za maskiranje:
- 80 % zamenjanih z posebnim tokenom [MASK], da se model nauči natančno napovedovati maskirane besede.
- 10 % zamenjanih z naključnimi tokeni, da se model ne preuči na vzorcu maskiranja in se nauči biti odporen na šum.
- 10 % ostane nespremenjenih (izvorni tokeni), da model ohrani kontekst in se ne preveč zanese na prisotnost [MASK].
Ta ravnotežje pomaga modelu bolje posploševati in se izogniti preučevanju na umetno ustvarjenih maskah.