պատմիր ինձ PagedAttention-ի մասին vLLM-ում։
sobes.tech AI
Պատասխան AI-ից
vLLM-ում PagedAttention-ը ուշադրության մեխանիզմի օպտիմիզացիա է, որը նախատեսված է երկար շարահյուսությունների մշակման համար տրանսֆորմատորներում: Կլասիկ self-attention-ում հաշվարկային բարդությունը և հիշողության սպառումը քառակուսային աճում են մուտքի երկարության հետ, ինչը սահմանափակում է ընդլայնելիությունը:
PagedAttention-ը բաժանում է շարահյուսությունը էջերի և հաշվարկում է ուշադրությունը մասամբ, ինչը թույլ է տալիս արդյունավետ օգտագործել հիշողությունը և արագացնել հաշվարկները: Սա հատկապես օգտակար է երկար կոնտեքստով տեքստի գեներացման ժամանակ, երբ անհրաժեշտ է պահել և մշակել մեծ քանակությամբ տոքեններ:
Ամենայն դեպս, այն աշխատում է այսպես՝
- Մուտքային շարահյուսությունը բաժանվում է ֆիքսված չափի էջերի:
- Աշխատում է էջի ներսում և որոշ էջերի միջև, որպեսզի պահպանվի կոնտեքստը:
- Օգտագործվում են օպտիմիզացիաներ՝ գործողությունների և հիշողության օգտագործման նվազեցման համար:
Այսպիսով, PagedAttention-ը թույլ է տալիս vLLM-ին ընդլայնվել երկար կոնտեքստների վրա՝ առանց ծախսերի էքսպոնենցիալ աճի: