Ce este gradientul de politică și ce afirmă teorema gradientului de politică?
sobes.tech AI
Răspuns de la AI
Gradientul de politică este o clasă de metode în învățarea prin întărire care optimizează direct strategia parametrizată (politica) folosind gradientul de coborâre.
În loc să evalueze funcția de valoare, metodele de gradient de politică actualizează parametrii politicii pentru a crește recompensa așteptată.
Teorema Gradientului de Politică exprimă formal gradientul recompensei așteptate în raport cu parametrii politicii:
[ \nabla_\theta J(\theta) = \mathbb{E}{\pi\theta} \left[ \nabla_\theta \log \pi_\theta(a|s) Q^{\pi_\theta}(s,a) \right] ]
unde:
- (J(\theta)) — recompensa așteptată cu politica cu parametri (\theta)
- (\pi_\theta(a|s)) — probabilitatea de a acționa (a) în starea (s)
- (Q^{\pi_\theta}(s,a)) — funcția de valoare a acțiunii
Această expresie permite estimarea gradientului folosind mostre din mediu și actualizarea parametrilor politicii în direcția creșterii recompensei.
Exemplu de o actualizare simplă a parametrilor:
# pseudo-cod
pentru fiecare episod:
colectează traiectoria folosind politica pi_theta
pentru fiecare (s, a, recompensă) în traiectorie:
grad = grad + grad_log_pi_theta(a|s) * recompensă
theta = theta + rată_de_învățare * grad
Metodele de gradient de politică sunt utilizate pe scară largă pentru antrenarea strategiilor complexe, mai ales când spațiul de acțiuni este continuu sau politica trebuie să fie stocastică.