Middle — Senior
BERT maskelemede neden 80/10/10 (maske, rastgele, orijinal)?
sobes.tech yapay zeka
AI'dan gelen yanıt
BERT'in ön eğitiminde, gizli kelimeleri tahmin etmek için modelin eğitilmesini sağlayan bir token maskeleme stratejisi kullanılır. 80/10/10 kuralı, maskelenmek üzere seçilen tüm tokenlar arasında:
- %80'i özel [MASK] tokeni ile değiştirilir, böylece model maskelenmiş kelimeleri tahmin etmeyi öğrenir.
- %10'u rastgele tokenlerle değiştirilir, böylece model maskeleme desenine aşırı uyum sağlamaz ve gürültüye dayanıklı olmayı öğrenir.
- %10'u değişmeden bırakılır (orijinal tokenlar), böylece model bağlamı korur ve [MASK] varlığına aşırı bağımlı olmaz.
Bu denge, modelin daha iyi genellemesine ve yapay olarak oluşturulmuş maskelere karşı aşırı uyumu önlemesine yardımcı olur.