Junior — Middle
Gradient Descent, SGD i Mini-Batch SGD: na czym polegają różnice, zalety i wady każdego z nich?
sobes.tech AI
Odpowiedź od AI
Gradient Descent (GD) — to metoda optymalizacji, w której gradienty są obliczane na całej próbce treningowej w jednej iteracji.
- Zalety: precyzyjny kierunek spadku, stabilne zmniejszanie funkcji straty.
- Wady: wolne iteracje przy dużych danych, wysokie obciążenie obliczeniowe.
Stochastic Gradient Descent (SGD) — gradienty są obliczane na jednym losowym przykładzie na iterację.
- Zalety: szybkie iteracje, mniej pamięci, może wychodzić z minimów lokalnych dzięki szumowi.
- Wady: wysoka dyspercja gradientów, mniej stabilne zachowanie, wymaga starannego dostosowania szybkości uczenia.
Mini-Batch SGD — kompromis między GD a SGD, gradienty są obliczane na małych podzbiorach (batchach).
- Zalety: balans między szybkością a stabilnością, efektywne wykorzystanie paralelizmu, wygładzanie szumu.
- Wady: wybór rozmiaru batcha wpływa na jakość i szybkość uczenia, wymaga dostosowania.
W praktyce Mini-Batch SGD jest najczęściej używany, ponieważ łączy zalety obu metod i dobrze się skalowal.