Sobes.tech
Middle — Senior

მითხარი PagedAttention-ის შესახებ vLLM-ში.

sobes.tech AI

პასუხი AI-სგან

vLLM-ში PagedAttention არის ყურადღების მექანიზმის ოპტიმიზაცია, რომელიც განკუთვნილია გრძელ სექვენციებს ტრანსფორმატორებში დამუშავებისთვის. კლასიკურ self-attention-ში, გამოთვლითი სირთულე და მეხსიერების მოხმარება იზრდება კვადრატულად შესვლის სიგრძესთან, რაც შეზღუდავს მასშტაბურობას.

PagedAttention იყოფა სექვენციას გვერდებად და ითვლის ყურადღებას ნაწილებად, რაც საშუალებას აძლევს ეფექტურად გამოიყენოს მეხსიერება და გაადვილოს გამოთვლები. ეს განსაკუთრებით სასარგებლოა გრძელ კონტექსტიან ტექსტის გენერაციისას, სადაც საჭიროა დიდი რაოდენობით ტოკენების შენახვა და დამუშავება.

მიმბაძველად მუშაობს ასე:

  • შესვლის სექვენცია ნაწილებად იყოფა ფიქსირებული ზომის გვერდებად.
  • ყურადღება ითვლება თითოეულ გვერდში და ზოგიერთ გვერდს შორის, რათა კონტექსტი შენარჩუნდეს.
  • ოპტიმიზაციები გამოიყენება ოპერაციების და მეხსიერების გამოყენების მინიმუმამდე დასაყენებლად.

ამ გზით, PagedAttention საშუალებას აძლევს vLLM-ს სკალირებას გრძელ კონტექსტებზე, გარეშე ხარჯების ექსპონენციული ზრდის.