Sobes.tech
Middle — Senior

Čo je policy gradient a čo hovorí veta policy gradient?

sobes.tech AI

Odpoveď od AI

Policy Gradient je razred metod v učnem pospeševanju, ki neposredno optimizira parametrično strategijo (politiko) z uporabo gradientnega spusta.

Namesto ocenjevanja funkcije vrednosti, metode policy gradient posodabljajo parametre politike tako, da povečajo pričakovano nagrado.

Teorema policy gradienta formalno izraža gradient pričakovane nagrade glede na parametre politike:

[ \nabla_\theta J(\theta) = \mathbb{E}{\pi\theta} \left[ \nabla_\theta \log \pi_\theta(a|s) Q^{\pi_\theta}(s,a) \right] ]

kjer:

  • (J(\theta)) — pričakovana nagrada s politiko s parametri (\theta)
  • (\pi_\theta(a|s)) — verjetnost dejanja (a) v stanju (s)
  • (Q^{\pi_\theta}(s,a)) — funkcija vrednosti dejanja

Ta izraz omogoča oceno gradienta s pomočjo vzorcev iz okolja in posodabljanje parametrov politike v smeri povečevanja nagrade.

Primer enostavne posodobitve parametrov:

# pseudo-kod
za vsak epizod:
    zberi trajektorijo z uporabo politike pi_theta
    za vsak (s, a, nagrada) v trajektoriji:
        grad = grad + grad_log_pi_theta(a|s) * nagrada
    theta = theta + stopnja_učenja * grad

Metode policy gradient se široko uporabljajo za usposabljanje kompleksnih strategij, zlasti kadar je prostor dejanj kontinuiran ali mora politika biti stohastična.