Sobes.tech
Senior

Šta je FlashAttention i kakvu dobit od memorije pruža?

sobes.tech АИ

Одговор од АИ

FlashAttention je optimizovani algoritam za izračunavanje mehanizma pažnje (attention) u transformatorima, koji značajno smanjuje potrošnju memorije i ubrzava izračunavanja u poređenju sa klasičnim pristupom.

Glavna ideja FlashAttention je da računa pažnju bez eksplicitnog skladištenja velikih matrica međurezultata (npr., matricu težina pažnje QK^T), koristeći blok obradu i efikasno korišćenje keš memorije GPU-a. Ovo omogućava smanjenje vršnog potrošenja memorije za otprilike 3-4 puta, što je posebno važno pri obuci velikih jezičkih modela (LLM) sa dugim sekvencama.

Otprilike, ako klasična pažnja zahteva memoriju O(N^2) za sekvencu dužine N, FlashAttention smanjuje ovo opterećenje putem računanja u realnom vremenu i optimizacija, omogućavajući pokretanje modela sa većim kontekstima na istim GPU-ovima.

Tako, FlashAttention je način da se pažnja učini efikasnijom u pogledu memorije i brzine, što je ključno za velike modele.