Sobes.tech
Senior

Mis on FlashAttention ja millist mälu kasu see pakub?

sobes.tech AI

Vastus AI-lt

FlashAttention on optimeeritud algoritm tähelepanu (attention) mehhanismi arvutamiseks transformaatorsüsteemides, mis oluliselt vähendab mälu kasutust ja kiirendab arvutusi võrreldes klassikalise lähenemisega.

FlashAttentioni peamine idee on arvutada tähelepanu ilma suuremate vahematriksite (näiteks tähelepanu kaalude maatriks QK^T) otsese salvestamiseta, kasutades plokki töötlemist ja GPU vahemälu tõhusat kasutamist. See võimaldab vähendada maksimaalset mälu kasutust umbes 3-4 korda, mis on eriti oluline suurte keelemudelite (LLM) treenimisel pikkade järjestuste puhul.

Umbes, kui klassikaline tähelepanu nõuab mälu O(N^2) järjestuse pikkuse N jaoks, siis FlashAttention vähendab seda koormust reaalajas arvutuste ja optimeerimiste abil, võimaldades käivitada suurema kontekstiga mudeleid sama GPU peal.

Seega on FlashAttention viis teha tähelepanu mälu- ja kiirusmõttes tõhusamaks, mis on kriitiline suurte mudelite jaoks.