Sobes.tech
Middle — Senior

Mi az a policy gradient és mi a policy gradient tétel?

sobes.tech MI

Válasz az MI-től

A Policy Gradient egy olyan módszertanok osztálya a megerősítő tanulásban, amelyek közvetlenül optimalizálják a parametrikus stratégiát (politikát) gradiens csökkenés segítségével.

Ahelyett, hogy értékfüggvényt becsülnének, a policy gradient módszerek a politika paramétereit frissítik, hogy növeljék a várható jutalmat.

A Policy Gradient Tétel formálisan kifejezi a várható jutalom gradiensét a politika paramétereire vonatkozóan:

[ \nabla_\theta J(\theta) = \mathbb{E}{\pi\theta} \left[ \nabla_\theta \log \pi_\theta(a|s) Q^{\pi_\theta}(s,a) \right] ]

ahol:

  • (J(\theta)) — a várható jutalom a paraméterezett politikával, amit (\theta) jelöl
  • (\pi_\theta(a|s)) — az esemény valószínűsége, hogy a (a) akciót választják az (s) állapotban
  • (Q^{\pi_\theta}(s,a)) — az akció értékfüggvénye

Ez a kifejezés lehetővé teszi a gradiens becslését a környezetből származó minták segítségével, és a politika paramétereinek frissítését a jutalom növelése irányába.

Egyszerű paraméterfrissítés példája:

# pszeudo-kód
minden epizód esetén:
    gyűjtsd össze a trajektóriát a pi_theta politika segítségével
    minden (s, a, jutalom) esetén a trajektóriában:
        grad = grad + grad_log_pi_theta(a|s) * jutalom
    theta = theta + tanulási_ráta * grad

A policy gradient módszerek széles körben alkalmazottak összetett stratégiák tanítására, különösen akkor, ha a cselekvési tér folyamatos vagy a politika stokasztikusnak kell lennie.