Middle — Senior
Kodėl moderniuose LLM-uose būtina nustatyti bias=False tiesinėse sluoksniuose?
sobes.tech AI
Atsakymas iš AI
Šiuolaikiniuose dideliuose kalbos modeliuose (LLM) dažnai nustatomas parametras bias=False tiesinėse sluoksniuose, siekiant pašalinti poslinkį (bias). Tai susiję su tuo, kad transformatorių architektūroje poslinkiai gali būti pertekliniai arba net žalingi, nes:
- LayerNorm jau apima poslinkį ir mastelį, kurie kompensuoja poreikį bias tiesinėse sluoksniuose.
- Bias pašalinimas sumažina parametrų skaičių ir gali pagerinti mokymosi stabilumą.
- Kai kuriais atvejais bias gali sukelti perteklinį parametrizavimą ir sumažinti modelio bendrąją gebėjimą.
Todėl bias=False padeda modelį padaryti kompaktiškesnį ir stabilesnį, ypač kai yra kitų poslinkio kompensavimo mechanizmų.
Pavyzdys PyTorch:
import torch.nn as nn
linear = nn.Linear(in_features=768, out_features=768, bias=False)