Sobes.tech
Junior — Middle

Gradient Descent, SGD i Mini-Batch SGD: na czym polegają różnice, zalety i wady każdego z nich?

sobes.tech AI

Odpowiedź od AI

Gradient Descent (GD) — to metoda optymalizacji, w której gradienty są obliczane na całej próbce treningowej w jednej iteracji.

  • Zalety: precyzyjny kierunek spadku, stabilne zmniejszanie funkcji straty.
  • Wady: wolne iteracje przy dużych danych, wysokie obciążenie obliczeniowe.

Stochastic Gradient Descent (SGD) — gradienty są obliczane na jednym losowym przykładzie na iterację.

  • Zalety: szybkie iteracje, mniej pamięci, może wychodzić z minimów lokalnych dzięki szumowi.
  • Wady: wysoka dyspercja gradientów, mniej stabilne zachowanie, wymaga starannego dostosowania szybkości uczenia.

Mini-Batch SGD — kompromis między GD a SGD, gradienty są obliczane na małych podzbiorach (batchach).

  • Zalety: balans między szybkością a stabilnością, efektywne wykorzystanie paralelizmu, wygładzanie szumu.
  • Wady: wybór rozmiaru batcha wpływa na jakość i szybkość uczenia, wymaga dostosowania.

W praktyce Mini-Batch SGD jest najczęściej używany, ponieważ łączy zalety obu metod i dobrze się skalowal.