Sobes.tech
Middle — Senior

Ce este gradientul de politică și ce afirmă teorema gradientului de politică?

sobes.tech AI

Răspuns de la AI

Gradientul de politică este o clasă de metode în învățarea prin întărire care optimizează direct strategia parametrizată (politica) folosind gradientul de coborâre.

În loc să evalueze funcția de valoare, metodele de gradient de politică actualizează parametrii politicii pentru a crește recompensa așteptată.

Teorema Gradientului de Politică exprimă formal gradientul recompensei așteptate în raport cu parametrii politicii:

[ \nabla_\theta J(\theta) = \mathbb{E}{\pi\theta} \left[ \nabla_\theta \log \pi_\theta(a|s) Q^{\pi_\theta}(s,a) \right] ]

unde:

  • (J(\theta)) — recompensa așteptată cu politica cu parametri (\theta)
  • (\pi_\theta(a|s)) — probabilitatea de a acționa (a) în starea (s)
  • (Q^{\pi_\theta}(s,a)) — funcția de valoare a acțiunii

Această expresie permite estimarea gradientului folosind mostre din mediu și actualizarea parametrilor politicii în direcția creșterii recompensei.

Exemplu de o actualizare simplă a parametrilor:

# pseudo-cod
pentru fiecare episod:
    colectează traiectoria folosind politica pi_theta
    pentru fiecare (s, a, recompensă) în traiectorie:
        grad = grad + grad_log_pi_theta(a|s) * recompensă
    theta = theta + rată_de_învățare * grad

Metodele de gradient de politică sunt utilizate pe scară largă pentru antrenarea strategiilor complexe, mai ales când spațiul de acțiuni este continuu sau politica trebuie să fie stocastică.