გთხოვთ ახსნათ სკეალირებული წერტილოვანი ყურადღების ფორმულა. რატომ უნდა გავყოთ sqrt(d_k)?
sobes.tech AI
პასუხი AI-სგან
Өлшемді скаляр көбейтіндінің назар механизмі — бұл назар механизмі, ол сұраулар (Q) және кілттер (K) скаляр көбейтінділеріне негізделген элементтердің салмақ коэффициенттерін есептейді. Формула келесідей:
[ \text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right) V ]
Мұнда:
- Q — сұраулар матрицасы,
- K — кілттер матрицасы,
- V — мәндер матрицасы,
- (d_k) — кілт векторларының өлшемі.
(\sqrt{d_k}) арқылы бөлу — скаляр көбейтіндінің нәтижесін масштабтау үшін қажет. Бұл қадамсыз, жоғары өлшемдерде мәндер тым үлкен болуы мүмкін, бұл softmax функциясының өте үлкен аргументтерін тудырады. Бұл "жоғалған градиенттер" мәселесін тудырады — softmax өте "қатаң" болады, бір элемент шамамен 1 салмақ алады, ал қалғандары — шамамен 0, бұл оқытуды нашарлатады. Масштабтау градиенттерді тұрақтандырады және модельдің конвергенциясын жақсартады.