Junior — Middle
Quels sont les problèmes de la fonction d'activation Sigmoid ? Où est-elle utilisée et comment est-elle interprétée ?
sobes.tech IA
Réponse de l'IA
La fonction d’activation Sigmoid a la forme:
[ \sigma(x) = \frac{1}{1 + e^{-x}} ]
Elle transforme toute valeur d’entrée en une plage (0, 1), ce qui est pratique pour l’interprétation comme une probabilité.
Problèmes du Sigmoid :
- Gradients qui s’atténuent : Pour des valeurs d’entrée de grande magnitude, la dérivée de la fonction est proche de zéro, ce qui ralentit l’apprentissage des réseaux profonds.
- Non centrée : La sortie est toujours positive, ce qui peut ralentir la convergence de la descente de gradient.
- Saturation : Pour des valeurs positives ou négatives importantes, la fonction se "sature", et les gradients deviennent très petits.
Application :
- Souvent utilisée en couche de sortie pour des tâches de classification binaire, où la sortie est interprétée comme une probabilité d’appartenance à une classe.
Interprétation :
La valeur de la fonction peut être perçue comme la probabilité qu’un objet appartienne à la classe positive. Par exemple, une sortie de 0.9 indique une probabilité de 90%.
Exemple d’utilisation en Python :
import numpy as np
def sigmoid(x):
return 1 / (1 + np.exp(-x))
output = sigmoid(2.0) # environ 0.88
Dans les réseaux profonds modernes, on préfère souvent ReLU et ses variantes en raison des problèmes du Sigmoid.