Middle — Senior
BERT niqoblashda nima uchun 80/10/10 (mask, tasodifiy, asl)?
sobes.tech AI
AIdan javob
BERTнинг олдинги ўқитишида, моделни ёпилган сўзларни тахмин қилиш учун токенларни маскалаш стратегияси қўлланилади. 80/10/10 қоидаси, маскалаш учун танланган барча токенлар орасида:
- 80% махсус [MASK] токенга алмаштирилади, шунда модел ёпилган сўзларни аниқ тахмин қилишни ўрганади.
- 10% тасодифий токенлар билан алмаштирилади, шунда модел маскалаш шаблонига ортиқча ўрганмайди ва шу шумга қарши туришни ўрганади.
- 10% ўзгармай қолади (оригинал токенлар), шунда модел контекстни сақлайди ва [MASK] мавжудлигига ортиқча таяна олмайди.
Бу мувозанат моделга яхшироқ умумлашишга ва сунъий яратилган маскаларга ортиқча ўрганишдан сақланишга ёрдам беради.