Junior — Middle
Descente de gradient, SGD et Mini-Batch SGD : quelles sont les différences, avantages et inconvénients de chacun ?
sobes.tech IA
Réponse de l'IA
Descente de Gradient (GD) — c'est une méthode d'optimisation où les gradients sont calculés sur l'ensemble de l'échantillon d'entraînement en une seule itération.
- Avantages : direction de descente précise, diminution stable de la fonction de perte.
- Inconvénients : itération lente avec de grands ensembles de données, charge computationnelle élevée.
Descente de Gradient Stochastique (SGD) — les gradients sont calculés sur un seul exemple aléatoire par itération.
- Avantages : itérations rapides, moins de mémoire, peut sortir des minima locaux grâce au bruit.
- Inconvénients : haute dispersion des gradients, comportement moins stable, nécessite un réglage précis du taux d'apprentissage.
Mini-Batch SGD — compromis entre GD et SGD, les gradients sont calculés sur de petits sous-ensembles (lots).
- Avantages : équilibre entre vitesse et stabilité, utilisation efficace du parallélisme, lissage du bruit.
- Inconvénients : la taille du lot influence la qualité et la vitesse d'apprentissage, nécessite un réglage.
En pratique, Mini-Batch SGD est le plus souvent utilisé, car il combine les avantages des deux méthodes et se scale bien.