Middle — Senior
Müasir LLM-lərdə Linear qatlarında niyə bias=False istifadə olunur?
sobes.tech Süni İntellekt
AI-dan cavab
Müasir böyük dil modellərində (LLM) tez-tez lineyar qatlamlarda bias=False parametri qoyulur, bu biasin (kənar) çıxarılması üçün. Bu, transformator arxitekturasında biasların artıq və ya hətta zərərli ola biləcəyi ilə əlaqədardır, çünki:
- LayerNorm (Layer Normalization) artıq ötürmə və ölçüləndirmə daxildir, bu da lineyar qatlarda bias ehtiyacını kompensasiya edir.
- Biasın çıxarılması parametr sayını azaldır və təlimin stabilliyini yaxşılaşdıra bilər.
- Bəzi hallarda, bias çox parametrliyə səbəb ola bilər və modelin ümumiləşdirmə qabiliyyətini azalda bilər.
Buna görə də, bias=False modeli daha kompakt və stabilləşdirilmiş edir, xüsusən digər bias kompensasiyası mexanizmləri mövcuddursa.
PyTorch nümunəsi:
import torch.nn as nn
linear = nn.Linear(in_features=768, out_features=768, bias=False)