Czym jest kwantyzacja tylko wag i kwantyzacja aktywacji?
sobes.tech AI
Odpowiedź od AI
Kwantyzacja tylko wag — to metoda kompresji sieci neuronowych, w której kwantyzowane są tylko wagi modelu (parametry), podczas gdy aktywacje pozostają w oryginalnym formacie (zwykle zmiennoprzecinkowym). To zmniejsza rozmiar modelu i przyspiesza inferencję, zachowując dokładność obliczeń aktywacji.
Kwantyzacja aktywacji — to kwantyzacja nie tylko wag, ale także aktywacji (wyjść warstw). Pozwala to na dodatkowe zmniejszenie wymagań pamięciowych i zasobów obliczeniowych, ale może prowadzić do większej utraty dokładności, ponieważ kwantyzacja aktywacji wpływa na dynamikę działania modelu.
W kontekście dużych modeli językowych (LLM) często stosuje się kwantyzację tylko wag, aby zmniejszyć rozmiar modelu bez istotnego pogorszenia jakości, natomiast kwantyzacja aktywacji jest stosowana do bardziej agresywnej optymalizacji, wymagającej starannego dostrojenia i kompensacji strat dokładności.