Sobes.tech
Senior

FlashAttention nədir və hansı yaddaş qazancı verir?

sobes.tech Süni İntellekt

AI-dan cavab

FlashAttention — bu transformatorlarda diqqət mexanizmini hesablamaq üçün optimallaşdırılmış algoritmdir və klassik yanaşma ilə müqayisədə yaddaş istifadəsini əhəmiyyətli dərəcədə azaldır və hesablamaları sürətləndirir.

FlashAttention-ın əsas ideyası, diqqət çəki matrisləri QK^T kimi böyük müvəqqəti nəticə matrislərini açıq şəkildə saxlamaq olmadan, blok emalı və GPU cache-dən səmərəli istifadə etməklə diqqət hesablamaqdır. Bu, təxminən 3-4 dəfə daha az yaddaş istifadəsinə imkan verir və uzun ardıcıllıqlara malik böyük dil modellərinin (LLM) öyrədilməsi zamanı xüsusilə vacibdir.

Təxminən, klassik diqqət N uzunluğunda ardıcıllıq üçün O(N^2) yaddaş tələb edirsə, FlashAttention bu yükü real vaxt hesablamaları və optimizasiyalar vasitəsilə azaldır və eyni GPU-larda daha böyük kontekstlərlə modellərin işlədilməsinə imkan verir.

Beləliklə, FlashAttention yaddaş və sürət baxımından diqqəti daha səmərəli etmək üçün bir yoldur və böyük miqyaslı modellər üçün kritikdir.