Ի՞նչ է շարունակական բեթչինգը և ինչպես է այն իրականացվում vLLM/TGI-ում։
sobes.tech AI
Պատասխան AI-ից
Կապակցական խմբագրման տեխնիկան մեքենայական ուսուցման մոդելի համար հարցումների մշակումն է, որի ժամանակ մուտքային inference հարցումները շարունակական և դինամիկ կերպով հավաքվում են խմբերով՝ առավելագույն արդյունավետության համար հաշվիչ ռեսուրսների օգտագործման և ուշացման նվազեցման նպատակով։ Փոխարենը սպասել որոշակի ժամանակի կամ որոշակի քանակի հարցումների, համակարգը մշտապես ձևավորում է հարցումների խմբեր և դրանք մշակում։
vLLM և TGI (Text Generation Inference)-ում, շարունակական խմբագրման իրականացմանը հասնում է անասինխրոն սպասումով և դինամիկ խմբերի ձևավորմամբ։ Օրինակ, երբ հարցում է գալիս, այն դրվում է հերթում, և շարժիչը փորձում է ձևավորել մի քանի հարցումներից բաղկացած խմբեր՝ առանց շատ երկար սպասելու առաջինին։ Եթե նոր հարցումներ չկան, ապա խմբը սկսվում է առկաով։ Սա թույլ է տալիս միաժամանակ մշակել մի քանի հարցում, արդյունավետ օգտագործելով GPU-ն և նվազեցնելով ուշացումը յուրաքանչյուր հարցում։
Մոտավորապես, դա wygląda է այսպես.
- Հարցումները գալիս են հերթում։
- Սպասում է մինչև հասնի առավելագույն խմբի չափին կամ ժամանակային սահմանափակումը լրանալուն։
- Գումարվում է մի խումբ և ուղարկվում մոդելին։
- Արդյունքները վերադառնում են հարցումներին։
Այս մոտեցումը հատկապես օգտակար է տրանսֆորմատորների համար, որտեղ խմբային մշակումը շատ ավելի արդյունավետ է, քան առանձին հարցումները։