Co je to policy gradient a co říká věta policy gradient?
sobes.tech AI
Odpověď od AI
Policy Gradient je třída metod v posilovaném učení, které přímo optimalizují parametrickou strategii (policy) pomocí gradientního sestupu.
Namísto odhadu hodnotové funkce aktualizují metody policy gradient parametry politiky tak, aby zvýšily očekávanou odměnu.
Věta o gradientu politiky formálně vyjadřuje gradient očekávané odměny vzhledem k parametrům politiky:
[ \nabla_\theta J(\theta) = \mathbb{E}{\pi\theta} \left[ \nabla_\theta \log \pi_\theta(a|s) Q^{\pi_\theta}(s,a) \right] ]
kde:
- (J(\theta)) — očekávaná odměna s politikou s parametry (\theta)
- (\pi_\theta(a|s)) — pravděpodobnost akce (a) ve stavu (s)
- (Q^{\pi_\theta}(s,a)) — funkce hodnoty akce
Tento výraz umožňuje odhadovat gradient pomocí vzorků z prostředí a aktualizovat parametry politiky směrem ke zvýšení odměny.
Příklad jednoduché aktualizace parametrů:
# pseudo-kód
pro každý epizod:
shromáždi trajektorii pomocí politiky pi_theta
pro každé (s, a, odměna) v trajektorii:
grad = grad + grad_log_pi_theta(a|s) * odměna
theta = theta + učící se rychlost * grad
Metody policy gradient jsou široce používány pro trénink složitých strategií, zejména když je prostor akcí spojitý nebo politika má být stochastická.