Siyasət gradienti nədir və siyasət gradienti teoreması nədir?
sobes.tech Süni İntellekt
AI-dan cavab
Siyasət Gradienti, gücləndirmə öyrənməsində parametrik strategiyanı (siyasəti) birbaşa optimallaşdıran gradient enişi istifadə edən metodlar sinfidir.
Dəyər funksiyasını qiymətləndirmək yerinə, siyasət gradienti metodları siyasət parametrlərini, gözlənilən mükafatı artırmaq üçün yeniləyir.
Siyasət Gradienti Teoreması rəsmi olaraq siyasət parametrlərinə görə gözlənilən mükafatın gradientini ifadə edir:
[ \nabla_\theta J(\theta) = \mathbb{E}{\pi\theta} \left[ \nabla_\theta \log \pi_\theta(a|s) Q^{\pi_\theta}(s,a) \right] ]
burada:
- (J(\theta)) — parametrli siyasətlə gözlənilən mükafat
- (\pi_\theta(a|s)) — (s) vəziyyətində (a) hərəkətinin ehtimalı
- (Q^{\pi_\theta}(s,a)) — hərəkətin dəyər funksiyası
Bu ifadə mühitdən alınan nümunələr vasitəsilə gradientin qiymətləndirilməsinə və siyasət parametrlərinin mükafatı artırmaq istiqamətində yenilənməsinə imkan verir.
Sadə parametr yeniləməsinin nümunəsi:
# pseudo-kod
hər epizod üçün:
siyasət pi_theta istifadə edərək trajektoriya topla
hər (s, a, mükafat) üçün trajektoriya:
grad = grad + grad_log_pi_theta(a|s) * mükafat
theta = theta + öyrənmə dərəcəsi * grad
Siyasət gradienti metodları mürəkkəb strategiyaların öyrədilməsində geniş istifadə olunur, xüsusən də hərəkət sahəsi davamlıdırsa və ya siyasət stoxastik olmalıdırsa.