Sobes.tech
Middle — Senior

¿Qué es el gradiente de política y qué establece la teorema del gradiente de política?

sobes.tech AI

Respuesta de la IA

El Gradiente de Políticas es una clase de métodos en aprendizaje por refuerzo que optimizan directamente la estrategia paramétrica (política) utilizando descenso de gradiente.

En lugar de evaluar la función de valor, los métodos de gradiente de política actualizan los parámetros de la política para aumentar la recompensa esperada.

El Teorema del Gradiente de Política expresa formalmente el gradiente de la recompensa esperada respecto a los parámetros de la política:

[ \nabla_\theta J(\theta) = \mathbb{E}{\pi\theta} \left[ \nabla_\theta \log \pi_\theta(a|s) Q^{\pi_\theta}(s,a) \right] ]

donde:

  • (J(\theta)) — recompensa esperada con la política con parámetros (\theta)
  • (\pi_\theta(a|s)) — probabilidad de la acción (a) en el estado (s)
  • (Q^{\pi_\theta}(s,a)) — función de valor de la acción

Esta expresión permite estimar el gradiente usando muestras del entorno y actualizar los parámetros de la política en la dirección de aumentar la recompensa.

Ejemplo de una actualización simple de los parámetros:

# pseudo-código
for each episodio:
    recolectar trayectoria usando la política pi_theta
    for cada (s, a, recompensa) en la trayectoria:
        grad = grad + grad_log_pi_theta(a|s) * recompensa
    theta = theta + tasa_de_aprendizaje * grad

Los métodos de gradiente de política se aplican ampliamente para entrenar estrategias complejas, especialmente cuando el espacio de acciones es continuo o la política debe ser estocástica.