Sobes.tech
Middle — Senior

BERT maskalanmasında niyə 80/10/10 (maska, təsadüfi, orijinal)?

sobes.tech Süni İntellekt

AI-dan cavab

BERT-in əvvəlcədən təlimində, modelin gizli sözləri proqnozlaşdırması üçün tokenlərin maskalanması strategiyası istifadə olunur. 80/10/10 qaydası, maskalanmaq üçün seçilmiş bütün tokenlər arasında:

  • 80%-i xüsusi [MASK] tokeni ilə dəyişdirilir ki, model maskalanmış sözləri dəqiq proqnozlaşdıra bilsin.
  • 10%-i təsadüfi tokenlərlə dəyişdirilir ki, model maskalanma nümunəsinə çox öyrənməsin və səs-küyə davamlı olmağı öyrənsin.
  • 10%-i dəyişməz saxlanılır (orijinal tokenlər), ki, model konteksti saxlasın və [MASK] mövcudluğuna çox asılı olmasın.

Bu balans modelin daha yaxşı ümumiləşməsinə və süni yaradılmış maskalara qarşı artıq öyrənmənin qarşısını almağa kömək edir.