Sobes.tech
Junior — Middle

Jakie są problemy funkcji aktywacji Sigmoid? Gdzie jest stosowana i jak jest interpretowana?

sobes.tech AI

Odpowiedź od AI

Funkcja aktywacji Sigmoid ma postać:

[ \sigma(x) = \frac{1}{1 + e^{-x}} ]

Przekształca dowolną wartość wejściową w zakres (0, 1), co jest wygodne do interpretacji jako prawdopodobieństwo.

Problemy Sigmoid:

  • Zanikające gradienty: Dla dużych wartości wejściowych po stronie bezwzględnej, pochodna funkcji jest bliska zeru, co spowalnia uczenie się głębokich sieci.
  • Brak centrowania: Wyjście jest zawsze dodatnie, co może spowalniać zbieżność spadku gradientu.
  • Nasycenie: Przy dużych dodatnich lub ujemnych wartościach funkcja "nasyca się", a gradienty stają się bardzo małe.

Zastosowanie:

  • Często używana na wyjściu w zadaniach klasyfikacji binarnej, gdzie wyjście interpretowane jest jako prawdopodobieństwo przynależności do klasy.

Interpretacja:

Wartość funkcji można traktować jako prawdopodobieństwo przynależności obiektu do klasy pozytywnej. Na przykład, wyjście 0.9 oznacza 90% prawdopodobieństwa.

Przykład użycia w Pythonie:

import numpy as np

def sigmoid(x):
    return 1 / (1 + np.exp(-x))

output = sigmoid(2.0)  # około 0.88

W nowoczesnych głębokich sieciach często preferuje się ReLU i jej warianty ze względu na problemy Sigmoid.