Sobes.tech
Middle — Senior

Kas ir politikas gradients un ko saka politikas gradients teorema?

sobes.tech AI

Atbilde no AI

Policy Gradient ir klases metodes pastiprināšanas mācībā, kas tieši optimizē parametrisko stratēģiju (politiku), izmantojot gradienta kritumu.

Tā vietā, lai novērtētu vērtības funkciju, policy gradient metodes atjaunina politikas parametrus, lai palielinātu gaidāmo atlīdzību.

Policy Gradient teorema formāli izsaka gaidāmās atlīdzības gradientu attiecībā uz politikas parametriem:

[ \nabla_\theta J(\theta) = \mathbb{E}{\pi\theta} \left[ \nabla_\theta \log \pi_\theta(a|s) Q^{\pi_\theta}(s,a) \right] ]

kur:

  • (J(\theta)) — gaidāmā atlīdzība ar parametrisko politiku, ko apzīmē ar (\theta)
  • (\pi_\theta(a|s)) — varbūtība veikt darbību (a) stāvoklī (s)
  • (Q^{\pi_\theta}(s,a)) — darbības vērtības funkcija

Šis izteiciens ļauj novērtēt gradientu, izmantojot paraugus no vides, un atjaunot politikas parametrus, lai palielinātu atlīdzību.

Vienkāršs parametru atjaunināšanas piemērs:

# pseido-kods
katrs epizodes:
    savākt trajektoriju, izmantojot politiku pi_theta
    katram (s, a, atlīdzība) trajektorijā:
        grad = grad + grad_log_pi_theta(a|s) * atlīdzība
    \(\theta\) atjaunot — ar mācīšanās ātrumu:
        \(\theta = \theta + mācīšanās_ātrums * grad\)

Policy gradient metodes plaši tiek izmantotas sarežģītu stratēģiju apmācībā, īpaši, ja darbību telpa ir nepārtraukta vai politika ir stohastiska.