Sobes.tech
Junior — Middle

Descente de gradient, SGD et Mini-Batch SGD : quelles sont les différences, avantages et inconvénients de chacun ?

sobes.tech IA

Réponse de l'IA

Descente de Gradient (GD) — c'est une méthode d'optimisation où les gradients sont calculés sur l'ensemble de l'échantillon d'entraînement en une seule itération.

  • Avantages : direction de descente précise, diminution stable de la fonction de perte.
  • Inconvénients : itération lente avec de grands ensembles de données, charge computationnelle élevée.

Descente de Gradient Stochastique (SGD) — les gradients sont calculés sur un seul exemple aléatoire par itération.

  • Avantages : itérations rapides, moins de mémoire, peut sortir des minima locaux grâce au bruit.
  • Inconvénients : haute dispersion des gradients, comportement moins stable, nécessite un réglage précis du taux d'apprentissage.

Mini-Batch SGD — compromis entre GD et SGD, les gradients sont calculés sur de petits sous-ensembles (lots).

  • Avantages : équilibre entre vitesse et stabilité, utilisation efficace du parallélisme, lissage du bruit.
  • Inconvénients : la taille du lot influence la qualité et la vitesse d'apprentissage, nécessite un réglage.

En pratique, Mini-Batch SGD est le plus souvent utilisé, car il combine les avantages des deux méthodes et se scale bien.