O que é o gradiente de política e qual é o teorema do gradiente de política?
sobes.tech IA
Resposta da IA
O Gradiente de Política é uma classe de métodos em aprendizagem por reforço que otimizam diretamente a estratégia paramétrica (política), usando descida de gradiente.
Em vez de avaliar a função de valor, os métodos de gradiente de política atualizam os parâmetros da política para aumentar a recompensa esperada.
O Teorema do Gradiente de Política expressa formalmente o gradiente da recompensa esperada em relação aos parâmetros da política:
[ \nabla_\theta J(\theta) = \mathbb{E}{\pi\theta} \left[ \nabla_\theta \log \pi_\theta(a|s) Q^{\pi_\theta}(s,a) \right] ]
onde:
- (J(\theta)) — recompensa esperada com a política com parâmetros (\theta)
- (\pi_\theta(a|s)) — probabilidade de ação (a) no estado (s)
- (Q^{\pi_\theta}(s,a)) — função de valor da ação
Esta expressão permite estimar o gradiente usando amostras do ambiente e atualizar os parâmetros da política na direção de aumentar a recompensa.
Exemplo de uma atualização simples dos parâmetros:
# pseudo-código
para cada episódio:
coletar trajetória usando a política pi_theta
para cada (s, a, recompensa) na trajetória:
grad = grad + grad_log_pi_theta(a|s) * recompensa
theta = theta + taxa_de_aprendizagem * grad
Métodos de gradiente de política são amplamente utilizados para treinar estratégias complexas, especialmente quando o espaço de ações é contínuo ou a política deve ser estocástica.