Sobes.tech
Middle — Senior

Mis on poliitika gradient ja mida ütleb poliitika gradienti teoreem?

sobes.tech AI

Vastus AI-lt

Policy Gradient on klass meetoditest tugevdamisõppes, mis otse optimeerib parametriseeritud strateegiat (poliitikat), kasutades gradientlangust.

Asendades väärtusfunktsiooni hindamise, uuendavad policy gradient meetodid poliitika parameetreid, et suurendada oodatavat preemiat.

Policy Gradienti teoreem väljendab ametliku kujul oodatava preemia gradienti poliitika parameetrite suhtes:

[ \nabla_\theta J(\theta) = \mathbb{E}{\pi\theta} \left[ \nabla_\theta \log \pi_\theta(a|s) Q^{\pi_\theta}(s,a) \right] ]

kus:

  • (J(\theta)) — oodatav preemia koos parameetritega poliitika, tähistatud (\theta)
  • (\pi_\theta(a|s)) — tõenäosus tegevusele (a) olekus (s)
  • (Q^{\pi_\theta}(s,a)) — tegevuse väärtusfunktsioon

See avaldis võimaldab hinnata gradienti, kasutades keskkonnast võetud näiteid ning uuendada poliitika parameetreid preemia suurendamise suunas.

Lihtne parameetrite uuendamise näide:

# pseudo-kood
iga iga episood:
    koguda trajektoor kasutades poliitikat pi_theta
    iga (s, a, preemia) trajektooris:
        gradient = gradient + gradient_log_pi_theta(a|s) * preemia
    \(\theta\) uuendada — õppimiskiirusega:
        \(\theta = \theta + õppimiskiirus * gradient\)

Policy gradient meetodid on laialdaselt kasutusel keerukate strateegiate treenimisel, eriti kui tegevusruum on pidev või poliitika peab olema stokastiline.