Kas ir politikas gradients un ko saka politikas gradients teorema?
sobes.tech AI
Atbilde no AI
Policy Gradient ir klases metodes pastiprināšanas mācībā, kas tieši optimizē parametrisko stratēģiju (politiku), izmantojot gradienta kritumu.
Tā vietā, lai novērtētu vērtības funkciju, policy gradient metodes atjaunina politikas parametrus, lai palielinātu gaidāmo atlīdzību.
Policy Gradient teorema formāli izsaka gaidāmās atlīdzības gradientu attiecībā uz politikas parametriem:
[ \nabla_\theta J(\theta) = \mathbb{E}{\pi\theta} \left[ \nabla_\theta \log \pi_\theta(a|s) Q^{\pi_\theta}(s,a) \right] ]
kur:
- (J(\theta)) — gaidāmā atlīdzība ar parametrisko politiku, ko apzīmē ar (\theta)
- (\pi_\theta(a|s)) — varbūtība veikt darbību (a) stāvoklī (s)
- (Q^{\pi_\theta}(s,a)) — darbības vērtības funkcija
Šis izteiciens ļauj novērtēt gradientu, izmantojot paraugus no vides, un atjaunot politikas parametrus, lai palielinātu atlīdzību.
Vienkāršs parametru atjaunināšanas piemērs:
# pseido-kods
katrs epizodes:
savākt trajektoriju, izmantojot politiku pi_theta
katram (s, a, atlīdzība) trajektorijā:
grad = grad + grad_log_pi_theta(a|s) * atlīdzība
\(\theta\) atjaunot — ar mācīšanās ātrumu:
\(\theta = \theta + mācīšanās_ātrums * grad\)
Policy gradient metodes plaši tiek izmantotas sarežģītu stratēģiju apmācībā, īpaši, ja darbību telpa ir nepārtraukta vai politika ir stohastiska.