¿Por qué no se puede aprender simplemente en las salidas del aumento de gradiente?
sobes.tech AI
Respuesta de la IA
En el refuerzo por gradiente, el entrenamiento se realiza en los residuos (gradientes del error), y no en las salidas mismas de los modelos anteriores. Si se intenta entrenar el siguiente algoritmo base simplemente en las salidas de los anteriores, el modelo no minimizará correctamente el error, ya que no considera la dirección y magnitud del error, solo la predicción final.
El entrenamiento en los gradientes permite corregir secuencialmente los errores de los modelos anteriores, lo que garantiza la convergencia y la mejora de la calidad. Si solo se entrena en las salidas, el modelo puede sobreajustarse o no alcanzar el óptimo, ya que no considera qué tan fuerte y en qué dirección se deben ajustar las predicciones.
Ejemplo: en el refuerzo por gradiente clásico, el siguiente regresor se entrena en la diferencia entre los valores verdaderos y las predicciones actuales (residuos), y no en las predicciones mismas.