Тамыр үзгүлтүксүз batching деген эмне жана ал vLLM/TGIда кантип ишке ашырылат?
sobes.tech AI
AIден жооп
Үзгийчек топтоо — бул машиналык үйрөнүү моделине суроолорду иштетүү техникасы, анда кирүүчү inference суроолору үзгийчек жана динамикалык түрдө топторго чогултулуп, эсептөө ресурстарын максималдуу пайдаланып, кечиктирүүнү азайтуу үчүн колдонулат. Белгилүү бир убакытты же белгилүү бир суроолор санын күтүүнүн ордуна, система үзгийчек келген суроолордон топтор түзүп, аларды иштетет.
vLLM жана TGI (Text Generation Inference) ичинде үзгийчек топтоо асинхрондук күтүүлөр жана динамикалык топ түзүү аркылуу ишке ашырылат. Мисалы, суроо келгенде, ал кезекке коюлат, жана мотор бир нече суроодон турган топ түзүүгө аракет кылат, биринчи суроону өтө узак күтпөстөн. Эгер жаңы суроолор болбосо, топ бар болгон менен ишке киргизилет. Бул бир убакта бир нече суроону иштетүүгө, GPU'нун эффективдүү пайдаланууга жана ар бир суроонун кечигүүсүн минималдаштырууга мүмкүндүк берет.
Жалпысынан, мындайча көрүнөт:
- Суроолор кезекке келет.
- Система максималдуу топ өлчөмүнө жеткенче же тайм-аут бүтө электе күтөт.
- Топ түзүлүп, моделге жөнөтүлөт.
- Натыйжалар кайра суроолорго бөлүштүрүлөт.
Бул ыкма трансформаторлор үчүн өзгөчө пайдалуу, анткени топтоо иштетүү бир суроого караганда кыйла натыйжалуу.