Sobes.tech
Middle — Senior

Wat is policy gradient en wat zegt de policy gradient-theorema?

sobes.tech AI

Antwoord van AI

Policy Gradient is een klasse methoden in reinforcement learning die direct de parametrische strategie (beleid) optimaliseert met behulp van gradient descent.

In plaats van de waarde functie te schatten, passen policy gradient methoden de parameters van het beleid aan om de verwachte beloning te verhogen.

De Policy Gradient Theorema drukt formeel de gradient uit van de verwachte beloning ten opzichte van de parameters van het beleid:

[ \nabla_\theta J(\theta) = \mathbb{E}{\pi\theta} \left[ \nabla_\theta \log \pi_\theta(a|s) Q^{\pi_\theta}(s,a) \right] ]

waar:

  • (J(\theta)) — verwachte beloning met het beleid met parameters (\theta)
  • (\pi_\theta(a|s)) — kans op actie (a) in toestand (s)
  • (Q^{\pi_\theta}(s,a)) — waarde functie van de actie

Deze uitdrukking maakt het mogelijk om de gradient te schatten met behulp van monsters uit de omgeving en de parameters van het beleid bij te werken in de richting van het verhogen van de beloning.

Voorbeeld van een eenvoudige parameterupdate:

# pseudo-code
voor elke episode:
    verzamel traject met policy pi_theta
    voor elke (s, a, beloning) in traject:
        grad = grad + grad_log_pi_theta(a|s) * beloning
    theta = theta + leersnelheid * grad

Policy gradient methoden worden veel gebruikt voor het trainen van complexe strategieën, vooral wanneer de actie-ruimte continu is of het beleid stochastisch moet zijn.