Sobes.tech
Middle — Senior

Πες μου για το PagedAttention στο vLLM.

sobes.tech AI

Απάντηση από AI

Το PagedAttention στο vLLM είναι μια βελτιστοποίηση του μηχανισμού προσοχής για την επεξεργασία μακρών ακολουθιών σε μετασχηματιστές. Στην κλασική αυτοπροσοχή, η υπολογιστική πολυπλοκότητα και η κατανάλωση μνήμης αυξάνονται τετραγωνικά με το μήκος της εισόδου, περιορίζοντας την κλιμάκωση.

Το PagedAttention διαιρεί την ακολουθία σε σελίδες και υπολογίζει την προσοχή τμηματικά, επιτρέποντας αποτελεσματική χρήση της μνήμης και επιτάχυνση των υπολογισμών. Αυτό είναι ιδιαίτερα χρήσιμο στην παραγωγή κειμένου με μεγάλο πλαίσιο, όπου χρειάζεται να διατηρούνται και να επεξεργάζονται πολλά tokens.

Λειτουργεί περίπου ως εξής:

  • Η εισερχόμενη ακολουθία διαιρείται σε σελίδες σταθερού μεγέθους.
  • Η προσοχή υπολογίζεται εντός κάθε σελίδας και μεταξύ ορισμένων σελίδων για τη διατήρηση του πλαισίου.
  • Χρησιμοποιούνται βελτιστοποιήσεις για ελαχιστοποίηση των λειτουργιών και της χρήσης μνήμης.

Έτσι, το PagedAttention επιτρέπει στο vLLM να κλιμακώνεται σε μακρά πλαίσια χωρίς εκθετική αύξηση του κόστους.