Junior — Middle
Gradient Descent, SGD și Mini-Batch SGD: care sunt diferențele, avantajele și dezavantajele fiecăruia?
sobes.tech AI
Răspuns de la AI
Gradient Descent (GD) — este un metodă de optimizare în care gradientii sunt calculați pe întreaga set de antrenament într-o singură iterație.
- Avantaje: direcție precisă de coborâre, reducere stabilă a funcției de pierdere.
- Dezavantaje: iterații lente cu date mari, sarcină computațională ridicată.
Stochastic Gradient Descent (SGD) — gradientii sunt calculați pe un singur exemplu aleatoriu pe iterație.
- Avantaje: iterații rapide, mai puțină memorie, poate ieși din minimele locale datorită zgomotului.
- Dezavantaje: dispersie mare a gradientilor, comportament mai puțin stabil, necesită ajustare atentă a ratei de învățare.
Mini-Batch SGD — compromis între GD și SGD, gradientii sunt calculați pe subgrupuri mici (batch-uri).
- Avantaje: echilibru între viteză și stabilitate, utilizare eficientă a paralelismului, netezirea zgomotului.
- Dezavantaje: alegerea dimensiunii batch-ului influențează calitatea și viteza de învățare, necesită ajustare.
În practică, Mini-Batch SGD este cel mai frecvent utilizat, deoarece combină avantajele ambelor metode și scalează bine.