Junior — Middle
Gradientní sestup, SGD a Mini-Batch SGD: v čem se liší, jaké jsou výhody a nevýhody každého?
sobes.tech AI
Odpověď od AI
Gradient Descent (GD) — je metoda optimalizace, při které jsou gradienty počítány na celé tréninkové sadě v jedné iteraci.
- Výhody: přesný směr sestupu, stabilní snižování ztrátové funkce.
- Nevýhody: pomalé iterace u velkých dat, vysoká výpočetní zátěž.
Stochastic Gradient Descent (SGD) — gradienty jsou počítány na jednom náhodném příkladu za iteraci.
- Výhody: rychlé iterace, méně paměti, může uniknout z lokálních minim.
- Nevýhody: vysoká dispersie gradientů, méně stabilní chování, vyžaduje pečlivé nastavení rychlosti učení.
Mini-Batch SGD — kompromis mezi GD a SGD, gradienty jsou počítány na malých podmnožinách (batchích).
- Výhody: rovnováha mezi rychlostí a stabilitou, efektivní využití paralelismu, vyhlazení šumu.
- Nevýhody: volba velikosti batche ovlivňuje kvalitu a rychlost učení, vyžaduje nastavení.
V praxi se nejčastěji používá Mini-Batch SGD, protože kombinuje výhody obou metod a dobře škáluje.