Čo je weight-only kvantizácia a kvantizácia aktivácie?
sobes.tech AI
Odpoveď od AI
Len kvantizácia váh — je metóda kompresie neurónových sietí, pri ktorej sú kvantizované iba váhy modelu (parametre), zatiaľ čo aktivácie zostávajú v pôvodnom formáte (zvyčajne s pohyblivou desatinnou čiarkou). To znižuje veľkosť modelu a zrýchľuje inferenciu, pričom zachováva presnosť výpočtov aktivácií.
Kvantizácia aktivácií — je kvantizácia nielen váh, ale aj výstupov vrstiev (aktivácií). To umožňuje ďalšie zníženie požiadaviek na pamäť a výpočtové zdroje, ale môže viesť k väčšej strate presnosti, pretože kvantizácia aktivácií ovplyvňuje dynamiku chodu modelu.
V kontexte veľkých jazykových modelov (LLM) sa často používa len kvantizácia váh na zníženie veľkosti modelu bez podstatného zhoršenia kvality, zatiaľ čo kvantizácia aktivácií sa aplikuje na agresívnejšiu optimalizáciu, ktorá vyžaduje starostlivé doladenie a kompenzáciu strát presnosti.