Sobes.tech
Middle — Senior

Prečo 80/10/10 v maskovaní BERT (maska, náhodná, originálna)?

sobes.tech AI

Odpoveď od AI

Pri predtreningu BERT-a uporablja se strategija maskiranja tokenov, da se model nauči napovedovati skrite besede. Pravilo 80/10/10 pomeni, da je od vseh izbranih tokenov za maskiranje:

  • 80 % zamenjanih z posebnim tokenom [MASK], da se model nauči natančno napovedovati maskirane besede.
  • 10 % zamenjanih z naključnimi tokeni, da se model ne preuči na vzorcu maskiranja in se nauči biti odporen na šum.
  • 10 % ostane nespremenjenih (izvorni tokeni), da model ohrani kontekst in se ne preveč zanese na prisotnost [MASK].

Ta ravnotežje pomaga modelu bolje posploševati in se izogniti preučevanju na umetno ustvarjenih maskah.