Sobes.tech
Middle — Senior

Šta je policy gradient i šta kaže teorem policy gradienta?

sobes.tech АИ

Одговор од АИ

Policy Gradient je klasa metoda u učenju pojačanja koja direktno optimizuje parametrsku strategiju (politiku) koristeći gradijentni spust.

Umesto procene funkcije vrednosti, metode policy gradient ažuriraju parametre politike tako da povećaju očekivanu nagradu.

Teorema policy gradienta formalno izražava gradijent očekivane nagrade u odnosu na parametre politike:

[ \nabla_\theta J(\theta) = \mathbb{E}{\pi\theta} \left[ \nabla_\theta \log \pi_\theta(a|s) Q^{\pi_\theta}(s,a) \right] ]

gde:

  • (J(\theta)) — očekivana nagrada sa politikom sa parametrima (\theta)
  • (\pi_\theta(a|s)) — verovatnoća akcije (a) u stanju (s)
  • (Q^{\pi_\theta}(s,a)) — funkcija vrednosti akcije

Ovaj izraz omogućava procenu gradijenta pomoću uzoraka iz okruženja i ažuriranje parametara politike u pravcu povećanja nagrade.

Primer jednostavnog ažuriranja parametara:

# pseudo-kod
za svako epizodu:
    prikupi trajektoriju koristeći politiku pi_theta
    za svako (s, a, nagrada) u trajektoriji:
        grad = grad + grad_log_pi_theta(a|s) * nagrada
    theta = theta + stopa_učenja * grad

Metode policy gradient široko se koriste za obuku složenih strategija, posebno kada je prostor akcija kontinuiran ili politika mora biti stohastička.