Mis on poliitika gradient ja mida ütleb poliitika gradienti teoreem?
sobes.tech AI
Vastus AI-lt
Policy Gradient on klass meetoditest tugevdamisõppes, mis otse optimeerib parametriseeritud strateegiat (poliitikat), kasutades gradientlangust.
Asendades väärtusfunktsiooni hindamise, uuendavad policy gradient meetodid poliitika parameetreid, et suurendada oodatavat preemiat.
Policy Gradienti teoreem väljendab ametliku kujul oodatava preemia gradienti poliitika parameetrite suhtes:
[ \nabla_\theta J(\theta) = \mathbb{E}{\pi\theta} \left[ \nabla_\theta \log \pi_\theta(a|s) Q^{\pi_\theta}(s,a) \right] ]
kus:
- (J(\theta)) — oodatav preemia koos parameetritega poliitika, tähistatud (\theta)
- (\pi_\theta(a|s)) — tõenäosus tegevusele (a) olekus (s)
- (Q^{\pi_\theta}(s,a)) — tegevuse väärtusfunktsioon
See avaldis võimaldab hinnata gradienti, kasutades keskkonnast võetud näiteid ning uuendada poliitika parameetreid preemia suurendamise suunas.
Lihtne parameetrite uuendamise näide:
# pseudo-kood
iga iga episood:
koguda trajektoor kasutades poliitikat pi_theta
iga (s, a, preemia) trajektooris:
gradient = gradient + gradient_log_pi_theta(a|s) * preemia
\(\theta\) uuendada — õppimiskiirusega:
\(\theta = \theta + õppimiskiirus * gradient\)
Policy gradient meetodid on laialdaselt kasutusel keerukate strateegiate treenimisel, eriti kui tegevusruum on pidev või poliitika peab olema stokastiline.