Sobes.tech
Middle — Senior

Siyasət gradienti nədir və siyasət gradienti teoreması nədir?

sobes.tech Süni İntellekt

AI-dan cavab

Siyasət Gradienti, gücləndirmə öyrənməsində parametrik strategiyanı (siyasəti) birbaşa optimallaşdıran gradient enişi istifadə edən metodlar sinfidir.

Dəyər funksiyasını qiymətləndirmək yerinə, siyasət gradienti metodları siyasət parametrlərini, gözlənilən mükafatı artırmaq üçün yeniləyir.

Siyasət Gradienti Teoreması rəsmi olaraq siyasət parametrlərinə görə gözlənilən mükafatın gradientini ifadə edir:

[ \nabla_\theta J(\theta) = \mathbb{E}{\pi\theta} \left[ \nabla_\theta \log \pi_\theta(a|s) Q^{\pi_\theta}(s,a) \right] ]

burada:

  • (J(\theta)) — parametrli siyasətlə gözlənilən mükafat
  • (\pi_\theta(a|s)) — (s) vəziyyətində (a) hərəkətinin ehtimalı
  • (Q^{\pi_\theta}(s,a)) — hərəkətin dəyər funksiyası

Bu ifadə mühitdən alınan nümunələr vasitəsilə gradientin qiymətləndirilməsinə və siyasət parametrlərinin mükafatı artırmaq istiqamətində yenilənməsinə imkan verir.

Sadə parametr yeniləməsinin nümunəsi:

# pseudo-kod
hər epizod üçün:
    siyasət pi_theta istifadə edərək trajektoriya topla
    hər (s, a, mükafat) üçün trajektoriya:
        grad = grad + grad_log_pi_theta(a|s) * mükafat
    theta = theta + öyrənmə dərəcəsi * grad

Siyasət gradienti metodları mürəkkəb strategiyaların öyrədilməsində geniş istifadə olunur, xüsusən də hərəkət sahəsi davamlıdırsa və ya siyasət stoxastik olmalıdırsa.