Sobes.tech
Junior — Middle

Gradient descent, SGD i Mini-Batch SGD: у чему се разликују, предности и мане сваког?

sobes.tech АИ

Одговор од АИ

Gradient Descent (GD) — ovo je metoda optimizacije u kojoj se gradijenti računaju na celokupnom skupu za obuku u jednoj iteraciji.

  • Prednosti: tačna smer spuštanja, stabilno smanjenje funkcije gubitka.
  • Nedostaci: spore iteracije kod velikih podataka, visoko računarsko opterećenje.

Stochastic Gradient Descent (SGD) — gradijenti se računaju na jednom slučajnom primeru po iteraciji.

  • Prednosti: brze iteracije, manje memorije, može izaći iz lokalnih minimuma zahvaljujući šumu.
  • Nedostaci: visoka disperzija gradijenata, manje stabilno ponašanje, zahteva pažljivo podešavanje brzine učenja.

Mini-Batch SGD — kompromis između GD i SGD, gradijenti se računaju na malim podskupovima (batchevima).

  • Prednosti: balans između brzine i stabilnosti, efikasno korišćenje paralelizma, izravnavanje šuma.
  • Nedostaci: izbor veličine batcheva utiče na kvalitet i brzinu učenja, zahteva podešavanje.

U praksi, Mini-Batch SGD se najčešće koristi, jer kombinuje prednosti obe metode i dobro se skalira.