Sobes.tech
Middle — Senior

O que é o gradiente de política e qual é o teorema do gradiente de política?

sobes.tech IA

Resposta da IA

O Gradiente de Política é uma classe de métodos em aprendizagem por reforço que otimizam diretamente a estratégia paramétrica (política), usando descida de gradiente.

Em vez de avaliar a função de valor, os métodos de gradiente de política atualizam os parâmetros da política para aumentar a recompensa esperada.

O Teorema do Gradiente de Política expressa formalmente o gradiente da recompensa esperada em relação aos parâmetros da política:

[ \nabla_\theta J(\theta) = \mathbb{E}{\pi\theta} \left[ \nabla_\theta \log \pi_\theta(a|s) Q^{\pi_\theta}(s,a) \right] ]

onde:

  • (J(\theta)) — recompensa esperada com a política com parâmetros (\theta)
  • (\pi_\theta(a|s)) — probabilidade de ação (a) no estado (s)
  • (Q^{\pi_\theta}(s,a)) — função de valor da ação

Esta expressão permite estimar o gradiente usando amostras do ambiente e atualizar os parâmetros da política na direção de aumentar a recompensa.

Exemplo de uma atualização simples dos parâmetros:

# pseudo-código
para cada episódio:
    coletar trajetória usando a política pi_theta
    para cada (s, a, recompensa) na trajetória:
        grad = grad + grad_log_pi_theta(a|s) * recompensa
    theta = theta + taxa_de_aprendizagem * grad

Métodos de gradiente de política são amplamente utilizados para treinar estratégias complexas, especialmente quando o espaço de ações é contínuo ou a política deve ser estocástica.