Sobes.tech
Senior

რა არის weight-only quantization და activation quantization?

sobes.tech AI

პასუხი AI-სგან

მხოლოდ წონების კვანტიზაცია — ეს არის ნეირონული ქსელების კომპრესიის მეთოდი, სადაც მხოლოდ მოდელის წონები (პარამეტრები) კვანტიზირებულია, ხოლო აქტივაციები რჩება თავდაპირველ ფორმატში (საშუალოდ ფლოუდინგ პოინტით). ეს ამცირებს მოდელის ზომას და აჩქარებს ინფერენციას, შენარჩუნებული აქტივაციების გამოთვლითი სიზუსტით.

აქტივაციების კვანტიზაცია — ეს არის არა მხოლოდ წონების, არამედ ფენების გამოსვლების (აქტივაციების) კვანტიზაცია. ეს საშუალებას აძლევს დამატებით შეამციროს მეხსიერებისა და გამოთვლითი რესურსების მოთხოვნები, მაგრამ შეიძლება გამოიწვიოს უფრო დიდი სიზუსტის დაკარგვა, რადგან აქტივაციების კვანტიზაცია გავლენას ახდენს მოდელის დინამიკაზე.

დიდი ენის მოდელების (LLM) კონტექსტში, ხშირად გამოიყენება მხოლოდ წონების კვანტიზაცია მოდელის ზომის შემცირების მიზნით, ხარისხის მნიშვნელოვანი გაუარესების გარეშე, ხოლო აქტივაციების კვანტიზაცია გამოიყენება უფრო აგრესიული ოპტიმიზაციისთვის, რომელიც მოითხოვს ზუსტ კორექტირებას და სიზუსტის დანაკარგების კომპენსაციას.