Middle — Senior
Защо 80/10/10 в маскирането на BERT (маска, произволна, оригинална)?
sobes.tech AI
Отговор от AI
При предварителното обучение на BERT се използва стратегия за маскиране на токени, за да се обучи моделът да предсказва скрити думи. Правилото 80/10/10 означава, че от всички избрани за маскиране токени:
- 80% се заменят със специален токен [MASK], за да научи моделът да предсказва точно маскираните думи.
- 10% се заменят с произволни токени, за да не се пренатоварва моделът върху шаблона за маскиране и да се научи да бъде устойчив на шум.
- 10% остават без промяна (оригиналните токени), за да запази моделът контекста и да не разчита твърде много на наличието на [MASK].
Този баланс помага на модела да обобщава по-добре и да избегне пренасищане с изкуствено създадени маски.