Junior — Middle
¿Cuáles son los problemas de la función de activación Sigmoid? ¿Dónde se aplica y cómo se interpreta?
sobes.tech AI
Respuesta de la IA
La función de activación Sigmoid tiene la forma:
[ \sigma(x) = \frac{1}{1 + e^{-x}} ]
Convierte cualquier valor de entrada en un rango (0, 1), lo cual es útil para interpretarlo como una probabilidad.
Problemas de Sigmoid:
- Gradientes que se atenúan: Para valores de entrada grandes en magnitud, la derivada de la función es cercana a cero, lo que ralentiza el entrenamiento de redes profundas.
- No centrado: La salida siempre es positiva, lo que puede ralentizar la convergencia del descenso de gradiente.
- Saturación: Para valores positivos o negativos grandes, la función se "satura", y los gradientes se vuelven muy pequeños.
Aplicación:
- Se usa a menudo en la capa de salida para tareas de clasificación binaria, donde la salida se interpreta como la probabilidad de pertenencia a una clase.
Interpretación:
El valor de la función puede interpretarse como la probabilidad de que un objeto pertenezca a la clase positiva. Por ejemplo, una salida de 0.9 indica un 90% de probabilidad.
Ejemplo de uso en Python:
import numpy as np
def sigmoid(x):
return 1 / (1 + np.exp(-x))
output = sigmoid(2.0) # aproximadamente 0.88
En redes profundas modernas, a menudo se prefieren ReLU y sus variantes debido a los problemas del Sigmoid.