Co je to weight-only kvantizace a kvantizace aktivace?
sobes.tech AI
Odpověď od AI
Pouze kvantizace vah — je metoda komprese neuronových sítí, při které jsou kvantizovány pouze váhy modelu (parametry), zatímco aktivace zůstávají ve svém původním formátu (obvykle s plovoucí desetinnou čárkou). To snižuje velikost modelu a urychluje inference, přičemž zachovává přesnost výpočtů aktivací.
Kvantizace aktivací — je kvantizace nejen vah, ale i výstupů vrstev (aktivací). To umožňuje dále snížit požadavky na paměť a výpočetní zdroje, ale může vést k větší ztrátě přesnosti, protože kvantizace aktivací ovlivňuje dynamiku chodu modelu.
V kontextu velkých jazykových modelů (LLM) se často používá pouze kvantizace vah ke snížení velikosti modelu bez podstatného zhoršení kvality, zatímco kvantizace aktivací se používá pro agresivnější optimalizaci, která vyžaduje pečlivé doladění a kompenzaci ztrát přesnosti.