Sobes.tech
Middle+

Por que a regularização L1 tende a zerar os pesos, enquanto a L2 não? Como isso é derivado matematicamente?

sobes.tech IA

Resposta da IA

A regularização L1 (Lasso) adiciona à função de perda a soma dos valores absolutos dos pesos ( \lambda \sum |w_i| ), enquanto a regularização L2 (Ridge) adiciona a soma dos quadrados dos pesos ( \lambda \sum w_i^2 ).

Matematicamente:

  • A regularização L1 leva a uma derivada descontínua em zero (não diferenciável em 0), o que favorece que alguns pesos se tornem exatamente zero, pois a otimização "tende" a pontos onde os pesos são exatamente nulos.
  • A regularização L2 tem uma forma quadrática suave, cuja derivada é (2\lambda w_i), levando a uma diminuição gradual dos pesos, mas não à sua nulificação exata.

Geometricamente, na otimização com restrição de penalidade L1, o conjunto de soluções factíveis tem forma de losango com ângulos agudos, o que aumenta a probabilidade de que a solução caia em pontos com coordenadas nulas (zero nos pesos). No caso da penalização L2, o conjunto é circular, o que não favorece a nulificação.

Exemplo:

\text{Penalização L1: } \lambda |w| \rightarrow \text{derivada não definida em } w=0
\text{Penalização L2: } \lambda w^2 \rightarrow \text{derivada } 2\lambda w

Portanto, a regularização L1 é usada para seleção de características, enquanto a L2 é usada para suavizar os pesos.