Sobes.tech
Senior

vLLM چیست و PagedAttention چرا لازم است؟

sobes.tech AI

Ҷавоб аз AI

vLLM — инҷо як муҳаррики баландсифати инференси моделҳои бузурги забон (LLM), ки барои истифодаи самараноки захираҳо ва масштабшавӣ оптимизатсия шудааст. Он имкон медиҳад, ки моделҳои калонро бо харҷи камтар аз хотира ва вақт иҷро кунад.

PagedAttention — ин техникаи оптимизатсияи диққат (attention) дар трансформаторҳо мебошад, ки дар vLLM истифода мешавад. Он секвенсҳои дарозро ба саҳифаҳо (чанкҳо) тақсим мекунад, то талаботи хотираро дар ҳангоми ҳисоб кардани диққат кам кунад, дар ҳоле ки сифати моделро нигоҳ медорад. Ин махсусан барои коркарди контекстҳои хеле дароз, ки механизми классикии диққат хеле сарфакор аст, муфид аст.

Бинобар ин, PagedAttention кӯмак мекунад, ки vLLM инференси моделҳои калонро самаранок масштаб кунад, истеъмоли хотираро кам кунад ва ҳисобҳоро суръат бахшад, бидуни талафоти назаррас дар сифати.