Sobes.tech
Middle — Senior

Защо 80/10/10 в маскирането на BERT (маска, произволна, оригинална)?

sobes.tech AI

Отговор от AI

При предварителното обучение на BERT се използва стратегия за маскиране на токени, за да се обучи моделът да предсказва скрити думи. Правилото 80/10/10 означава, че от всички избрани за маскиране токени:

  • 80% се заменят със специален токен [MASK], за да научи моделът да предсказва точно маскираните думи.
  • 10% се заменят с произволни токени, за да не се пренатоварва моделът върху шаблона за маскиране и да се научи да бъде устойчив на шум.
  • 10% остават без промяна (оригиналните токени), за да запази моделът контекста и да не разчита твърде много на наличието на [MASK].

Този баланс помага на модела да обобщава по-добре и да избегне пренасищане с изкуствено създадени маски.