Sobes.tech
Senior

O que é quantização apenas de peso e quantização de ativação?

sobes.tech IA

Resposta da IA

Quantização apenas de pesos — é um método de compressão de redes neurais em que apenas os pesos do modelo (parâmetros) são quantizados, enquanto as ativações permanecem no formato original (geralmente de ponto flutuante). Isso reduz o tamanho do modelo e acelera a inferência, mantendo a precisão nos cálculos de ativação.

Quantização de ativações — é a quantização não apenas dos pesos, mas também das ativações (saídas das camadas). Isso permite reduzir ainda mais os requisitos de memória e recursos computacionais, mas pode levar a uma maior perda de precisão, pois a quantização das ativações afeta a dinâmica do funcionamento do modelo.

No contexto de grandes modelos de linguagem (LLM), a quantização apenas de pesos é frequentemente usada para reduzir o tamanho do modelo sem uma deterioração significativa na qualidade, enquanto a quantização de ativações é aplicada para uma otimização mais agressiva, exigindo ajuste cuidadoso e compensação pelas perdas de precisão.