Sobes.tech
Middle — Senior

Co je to policy gradient a co říká věta policy gradient?

sobes.tech AI

Odpověď od AI

Policy Gradient je třída metod v posilovaném učení, které přímo optimalizují parametrickou strategii (policy) pomocí gradientního sestupu.

Namísto odhadu hodnotové funkce aktualizují metody policy gradient parametry politiky tak, aby zvýšily očekávanou odměnu.

Věta o gradientu politiky formálně vyjadřuje gradient očekávané odměny vzhledem k parametrům politiky:

[ \nabla_\theta J(\theta) = \mathbb{E}{\pi\theta} \left[ \nabla_\theta \log \pi_\theta(a|s) Q^{\pi_\theta}(s,a) \right] ]

kde:

  • (J(\theta)) — očekávaná odměna s politikou s parametry (\theta)
  • (\pi_\theta(a|s)) — pravděpodobnost akce (a) ve stavu (s)
  • (Q^{\pi_\theta}(s,a)) — funkce hodnoty akce

Tento výraz umožňuje odhadovat gradient pomocí vzorků z prostředí a aktualizovat parametry politiky směrem ke zvýšení odměny.

Příklad jednoduché aktualizace parametrů:

# pseudo-kód
pro každý epizod:
    shromáždi trajektorii pomocí politiky pi_theta
    pro každé (s, a, odměna) v trajektorii:
        grad = grad + grad_log_pi_theta(a|s) * odměna
    theta = theta + učící se rychlost * grad

Metody policy gradient jsou široce používány pro trénink složitých strategií, zejména když je prostor akcí spojitý nebo politika má být stochastická.