Sobes.tech
Middle — Senior

дар бораи PagedAttention дар vLLM гап зан.

sobes.tech AI

Ҷавоб аз AI

PagedAttention дар vLLM — ин оптимизатсияи механизми диққат барои коркарди пайдарпайи дароз дар трансформаторҳо мебошад. Дар диққати худкори классикӣ, мураккабии ҳисоббарорӣ ва истифодаи хотира ду баробар бо дарозии вуруд меафзояд, ки ин маҳдудияти масштабро ба вуҷуд меорад.

PagedAttention пайдарпайро ба саҳифаҳо тақсим мекунад ва диққатро қисм-каси ҳисоб мекунад, ки ин имкон медиҳад истифодаи муассири хотира ва суръат бахшидани ҳисобҳо. Ин махсусан дар истеҳсоли матн бо контексти дароз, ки дар он бояд шумораи зиёди токенҳоро нигоҳ дошт ва кор кард, муфид аст.

Ҳамагӣ чунин кор мекунад:

  • Пайдарпайи вуруд ба саҳифаҳои бо андозаи муайян тақсим мешавад.
  • Диққат дар дохили ҳар саҳифа ва байни баъзе саҳифаҳо ҳисоб карда мешавад, то контекст нигоҳ дошта шавад.
  • Оптимизатсияҳо барои кам кардани амалҳо ва истифодаи хотира истифода мешаванд.

Бинобар ин, PagedAttention имкон медиҳад, ки vLLM ба контекстҳои дароз мепайвандад, бе афзоиши экспоненсиалӣ дар хароҷот.