Sobes.tech
Middle — Senior

Was ist der Policy-Gradient und was besagt der Policy-Gradient-Theorem?

sobes.tech KI

Antwort von AI

Policy Gradient ist eine Klasse von Methoden im Reinforcement Learning, die direkt die parametrische Strategie (Policy) mittels Gradientenabstieg optimieren.

Anstatt die Wertfunktion zu schätzen, aktualisieren Policy-Gradient-Methoden die Parameter der Policy, um die erwartete Belohnung zu erhöhen.

Der Policy-Gradientensatz drückt formal den Gradienten der erwarteten Belohnung bezüglich der Policy-Parameter aus:

[ \nabla_\theta J(\theta) = \mathbb{E}{\pi\theta} \left[ \nabla_\theta \log \pi_\theta(a|s) Q^{\pi_\theta}(s,a) \right] ]

wobei:

  • (J(\theta)) — erwartete Belohnung bei der Policy mit Parametern (\theta)
  • (\pi_\theta(a|s)) — Wahrscheinlichkeit der Aktion (a) im Zustand (s)
  • (Q^{\pi_\theta}(s,a)) — Wertfunktion der Aktion

Diese Gleichung ermöglicht die Schätzung des Gradienten anhand von Stichproben aus der Umgebung und die Aktualisierung der Policy-Parameter in Richtung einer Steigerung der Belohnung.

Beispiel für eine einfache Parameteraktualisierung:

# Pseudo-Code
für jede Episode:
    Trajektorie mit Policy pi_theta sammeln
    für jedes (s, a, Belohnung) in der Trajektorie:
        grad = grad + grad_log_pi_theta(a|s) * Belohnung
    theta = theta + Lernrate * grad

Policy-Gradient-Methoden werden breit angewendet, um komplexe Strategien zu trainieren, insbesondere wenn der Aktionsraum kontinuierlich ist oder die Policy stochastisch sein soll.