Mis on vLLM ja milleks on vajalik PagedAttention?
sobes.tech AI
Vastus AI-lt
vLLM on kõrge jõudlusega mootor suurte keelemudelite (LLM) inferentsiks, optimeeritud ressursside tõhusaks kasutamiseks ja skaleerimiseks. See võimaldab suuremaid mudeleid käivitada väiksema mälu ja aja kuluga.
PagedAttention on tähelepanu (attention) optimeerimise tehnika transformaatorsüsteemides, mida kasutatakse vLLM-is. See jagab pikad järjestused lehekülgedeks (tükid), et vähendada mälu nõudeid tähelepanu arvutamisel, säilitades samal ajal mudeli kvaliteedi. See on eriti kasulik väga pikkade kontekstide töötlemisel, kus klassikaline tähelepanu mehhanism muutub liiga ressursinõudlikuks.
Seega aitab PagedAttention vLLM-il tõhusalt suurendada suurte mudelite inferentsi, vähendada mälu kasutust ja kiirendada arvutusi, ilma olulise kvaliteedi kaota.