Sobes.tech
Middle — Senior

Parlami di PagedAttention in vLLM.

sobes.tech AI

Risposta dell'AI

PagedAttention in vLLM è un'ottimizzazione del meccanismo di attenzione per l'elaborazione di sequenze lunghe nei trasformatori. Nell'attenzione auto-classica, la complessità computazionale e il consumo di memoria crescono quadraticamente con la lunghezza dell'input, limitando la scalabilità.

PagedAttention divide la sequenza in pagine e calcola l'attenzione a pezzi, permettendo un uso efficiente della memoria e accelerando i calcoli. Questo è particolarmente utile nella generazione di testo con un lungo contesto, dove è necessario mantenere e processare un grande numero di token.

Funziona più o meno così:

  • La sequenza di input viene divisa in pagine di dimensione fissa.
  • L'attenzione viene calcolata all'interno di ogni pagina e tra alcune pagine per preservare il contesto.
  • Sono utilizzate ottimizzazioni per minimizzare operazioni e uso di memoria.

In questo modo, PagedAttention permette a vLLM di scalare a contesti lunghi senza una crescita esponenziale dei costi.