Junior — Middle
Jaké jsou problémy aktivační funkce Sigmoid? Kde se používá a jak se interpretuje?
sobes.tech AI
Odpověď od AI
Sigmoid aktivační funkce má tvar:
[ \sigma(x) = \frac{1}{1 + e^{-x}} ]
Převádí jakoukoli vstupní hodnotu do rozsahu (0, 1), což je vhodné pro interpretaci jako pravděpodobnost.
Problémy Sigmoidu:
- Vymizelé gradienty: U velkých hodnot vstupu je derivace funkce blízko nule, což zpomaluje učení hlubokých sítí.
- Nekontrovanost: Výstup je vždy kladný, což může zpomalit konvergenci gradientního sestupu.
- Saturace: U velkých kladných nebo záporných hodnot se funkce "saturuje" a gradienty jsou velmi malé.
Použití:
- Často se používá v poslední vrstvě pro binární klasifikaci, kde je výstup interpretován jako pravděpodobnost příslušnosti ke třídě.
Interpretace:
Hodnota funkce může být vnímána jako pravděpodobnost, že objekt patří do pozitivní třídy. Například výstup 0.9 znamená 90% pravděpodobnost.
Příklad v Pythonu:
import numpy as np
def sigmoid(x):
return 1 / (1 + np.exp(-x))
output = sigmoid(2.0) # přibližně 0.88
V moderních hlubokých sítích se často preferuje ReLU a její varianty kvůli problémům Sigmoidu.