Šta je policy gradient i šta kaže teorem policy gradienta?
sobes.tech АИ
Одговор од АИ
Policy Gradient je klasa metoda u učenju pojačanja koja direktno optimizuje parametrsku strategiju (politiku) koristeći gradijentni spust.
Umesto procene funkcije vrednosti, metode policy gradient ažuriraju parametre politike tako da povećaju očekivanu nagradu.
Teorema policy gradienta formalno izražava gradijent očekivane nagrade u odnosu na parametre politike:
[ \nabla_\theta J(\theta) = \mathbb{E}{\pi\theta} \left[ \nabla_\theta \log \pi_\theta(a|s) Q^{\pi_\theta}(s,a) \right] ]
gde:
- (J(\theta)) — očekivana nagrada sa politikom sa parametrima (\theta)
- (\pi_\theta(a|s)) — verovatnoća akcije (a) u stanju (s)
- (Q^{\pi_\theta}(s,a)) — funkcija vrednosti akcije
Ovaj izraz omogućava procenu gradijenta pomoću uzoraka iz okruženja i ažuriranje parametara politike u pravcu povećanja nagrade.
Primer jednostavnog ažuriranja parametara:
# pseudo-kod
za svako epizodu:
prikupi trajektoriju koristeći politiku pi_theta
za svako (s, a, nagrada) u trajektoriji:
grad = grad + grad_log_pi_theta(a|s) * nagrada
theta = theta + stopa_učenja * grad
Metode policy gradient široko se koriste za obuku složenih strategija, posebno kada je prostor akcija kontinuiran ili politika mora biti stohastička.