Middle — Senior
BERT maskalanmasında niyə 80/10/10 (maska, təsadüfi, orijinal)?
sobes.tech Süni İntellekt
AI-dan cavab
BERT-in əvvəlcədən təlimində, modelin gizli sözləri proqnozlaşdırması üçün tokenlərin maskalanması strategiyası istifadə olunur. 80/10/10 qaydası, maskalanmaq üçün seçilmiş bütün tokenlər arasında:
- 80%-i xüsusi [MASK] tokeni ilə dəyişdirilir ki, model maskalanmış sözləri dəqiq proqnozlaşdıra bilsin.
- 10%-i təsadüfi tokenlərlə dəyişdirilir ki, model maskalanma nümunəsinə çox öyrənməsin və səs-küyə davamlı olmağı öyrənsin.
- 10%-i dəyişməz saxlanılır (orijinal tokenlər), ki, model konteksti saxlasın və [MASK] mövcudluğuna çox asılı olmasın.
Bu balans modelin daha yaxşı ümumiləşməsinə və süni yaradılmış maskalara qarşı artıq öyrənmənin qarşısını almağa kömək edir.