Junior — Middle
Gradiente Descendente, SGD y Mini-Batch SGD: ¿en qué se diferencian, ventajas y desventajas de cada uno?
sobes.tech AI
Respuesta de la IA
Gradiente Descendente (GD) — es un método de optimización en el que los gradientes se calculan en toda la muestra de entrenamiento en una sola iteración.
- Ventajas: dirección de descenso precisa, reducción estable de la función de pérdida.
- Desventajas: iteración lenta con grandes datos, alta carga computacional.
Gradiente Descendente Estocástico (SGD) — los gradientes se calculan en un solo ejemplo aleatorio por iteración.
- Ventajas: iteraciones rápidas, menor uso de memoria, puede escapar de mínimos locales gracias al ruido.
- Desventajas: alta dispersión de los gradientes, comportamiento menos estable, requiere ajuste cuidadoso de la tasa de aprendizaje.
Mini-Batch SGD — compromiso entre GD y SGD, los gradientes se calculan en pequeños subconjuntos (lotes).
- Ventajas: equilibrio entre velocidad y estabilidad, uso eficiente del paralelismo, suavizado del ruido.
- Desventajas: la elección del tamaño del lote afecta la calidad y velocidad de aprendizaje, requiere ajuste.
En la práctica, Mini-Batch SGD se usa con más frecuencia, ya que combina las ventajas de ambos métodos y escala bien.