Junior — Middle
Gradient descent, SGD i Mini-Batch SGD: у чему се разликују, предности и мане сваког?
sobes.tech АИ
Одговор од АИ
Gradient Descent (GD) — ovo je metoda optimizacije u kojoj se gradijenti računaju na celokupnom skupu za obuku u jednoj iteraciji.
- Prednosti: tačna smer spuštanja, stabilno smanjenje funkcije gubitka.
- Nedostaci: spore iteracije kod velikih podataka, visoko računarsko opterećenje.
Stochastic Gradient Descent (SGD) — gradijenti se računaju na jednom slučajnom primeru po iteraciji.
- Prednosti: brze iteracije, manje memorije, može izaći iz lokalnih minimuma zahvaljujući šumu.
- Nedostaci: visoka disperzija gradijenata, manje stabilno ponašanje, zahteva pažljivo podešavanje brzine učenja.
Mini-Batch SGD — kompromis između GD i SGD, gradijenti se računaju na malim podskupovima (batchevima).
- Prednosti: balans između brzine i stabilnosti, efikasno korišćenje paralelizma, izravnavanje šuma.
- Nedostaci: izbor veličine batcheva utiče na kvalitet i brzinu učenja, zahteva podešavanje.
U praksi, Mini-Batch SGD se najčešće koristi, jer kombinuje prednosti obe metode i dobro se skalira.