Mi az a policy gradient és mi a policy gradient tétel?
sobes.tech MI
Válasz az MI-től
A Policy Gradient egy olyan módszertanok osztálya a megerősítő tanulásban, amelyek közvetlenül optimalizálják a parametrikus stratégiát (politikát) gradiens csökkenés segítségével.
Ahelyett, hogy értékfüggvényt becsülnének, a policy gradient módszerek a politika paramétereit frissítik, hogy növeljék a várható jutalmat.
A Policy Gradient Tétel formálisan kifejezi a várható jutalom gradiensét a politika paramétereire vonatkozóan:
[ \nabla_\theta J(\theta) = \mathbb{E}{\pi\theta} \left[ \nabla_\theta \log \pi_\theta(a|s) Q^{\pi_\theta}(s,a) \right] ]
ahol:
- (J(\theta)) — a várható jutalom a paraméterezett politikával, amit (\theta) jelöl
- (\pi_\theta(a|s)) — az esemény valószínűsége, hogy a (a) akciót választják az (s) állapotban
- (Q^{\pi_\theta}(s,a)) — az akció értékfüggvénye
Ez a kifejezés lehetővé teszi a gradiens becslését a környezetből származó minták segítségével, és a politika paramétereinek frissítését a jutalom növelése irányába.
Egyszerű paraméterfrissítés példája:
# pszeudo-kód
minden epizód esetén:
gyűjtsd össze a trajektóriát a pi_theta politika segítségével
minden (s, a, jutalom) esetén a trajektóriában:
grad = grad + grad_log_pi_theta(a|s) * jutalom
theta = theta + tanulási_ráta * grad
A policy gradient módszerek széles körben alkalmazottak összetett stratégiák tanítására, különösen akkor, ha a cselekvési tér folyamatos vagy a politika stokasztikusnak kell lennie.