Sobes.tech
Middle — Senior

պատմիր ինձ PagedAttention-ի մասին vLLM-ում։

sobes.tech AI

Պատասխան AI-ից

vLLM-ում PagedAttention-ը ուշադրության մեխանիզմի օպտիմիզացիա է, որը նախատեսված է երկար շարահյուսությունների մշակման համար տրանսֆորմատորներում: Կլասիկ self-attention-ում հաշվարկային բարդությունը և հիշողության սպառումը քառակուսային աճում են մուտքի երկարության հետ, ինչը սահմանափակում է ընդլայնելիությունը:

PagedAttention-ը բաժանում է շարահյուսությունը էջերի և հաշվարկում է ուշադրությունը մասամբ, ինչը թույլ է տալիս արդյունավետ օգտագործել հիշողությունը և արագացնել հաշվարկները: Սա հատկապես օգտակար է երկար կոնտեքստով տեքստի գեներացման ժամանակ, երբ անհրաժեշտ է պահել և մշակել մեծ քանակությամբ տոքեններ:

Ամենայն դեպս, այն աշխատում է այսպես՝

  • Մուտքային շարահյուսությունը բաժանվում է ֆիքսված չափի էջերի:
  • Աշխատում է էջի ներսում և որոշ էջերի միջև, որպեսզի պահպանվի կոնտեքստը:
  • Օգտագործվում են օպտիմիզացիաներ՝ գործողությունների և հիշողության օգտագործման նվազեցման համար:

Այսպիսով, PagedAttention-ը թույլ է տալիս vLLM-ին ընդլայնվել երկար կոնտեքստների վրա՝ առանց ծախսերի էքսպոնենցիալ աճի: