Middle — Senior
Zašto je u modernim LLM-ovima potrebno postaviti bias=False u linearne slojeve?
sobes.tech АИ
Одговор од АИ
У савременим великим моделима језика (LLM) често се поставља параметар bias=False у линијским слојевима како би се уклонио помак (bias). То је повезано са тиме да у архитектури трансформатора помаци могу бити вишак или чак штетни, јер:
- LayerNorm (нормализација слоја) већ укључује помак и скалирање, што компензује потребу за bias у линијским слојевима.
- Уклањање bias-а смањује број параметара и може побољшати стабилност учења.
- У одређеним случајевима, bias може довести до прекомерне параметризације и смањити способност модела да општи.
Због тога, bias=False помаже да модел буде компактнији и стабилнији, посебно када постоје други механизми за компензацију помака.
Пример у PyTorch-у:
import torch.nn as nn
linear = nn.Linear(in_features=768, out_features=768, bias=False)