Sobes.tech
Middle — Senior

Ի՞նչ է քաղաքականության գրաֆիկը և ինչ է ասում քաղաքականության գրաֆիկի տեսությունը։

sobes.tech AI

Պատասխան AI-ից

Policy Gradient-ը դաս է մեթոդների, որոնք ուղղակիորեն օպտիմալացնում են պարամետրային ռազմավարությունը (պոլիտիկան) օգտագործելով գրադիենտային իջեցում:

Ի տարբերություն արժեքի ֆունկցիայի գնահատման, policy gradient մեթոդները թարմացնում են քաղաքականության պարամետրերը՝ բարձրացնելու սպասվող պարգևը:

Policy Gradient-ի Թեորեմը պաշտոնապես արտահայտում է սպասվող պարգևի գրադիենտը քաղաքականության պարամետրերի նկատմամբ՝

[ \nabla_\theta J(\theta) = \mathbb{E}{\pi\theta} \left[ \nabla_\theta \log \pi_\theta(a|s) Q^{\pi_\theta}(s,a) \right] ]

որտեղ՝

  • (J(\theta)) — սպասվող պարգևը պարամետրային քաղաքականությամբ, որը նշվում է (\theta)
  • (\pi_\theta(a|s)) — հավանականությունը գործողության (a)՝ վիճակում (s)
  • (Q^{\pi_\theta}(s,a)) — գործողության արժեքային ֆունկցիա

Այս արտահայտությունը թույլ է տալիս գնահատել գրադիենտը միջավայրից վերցված նմուշների միջոցով և թարմացնել քաղաքականության պարամետրերը՝ պարգևը բարձրացնելու ուղղությամբ:

Պարզ պարամետրային թարմացման օրինակ՝

# սիմվոլիկ կոդ
յուրաքանչյուր էպիզոդի համար՝
    հավաքել տրեյլի օգտագործելով policy pi_theta
    յուրաքանչյուր (s, a, պարգև) տրեյլում՝
        գրադիենտ = գրադիենտ + գրադիենտ_log_pi_theta(a|s) * պարգև
    \(\theta\) թարմացնել՝ ուսուցման արագությամբ՝
        \(\theta = \theta + \text{ուսուցման արագություն} * \text{գրադիենտ}\)

Policy gradient մեթոդները լայնորեն կիրառվում են բարդ ռազմավարությունների ուսուցման համար, հատկապես երբ գործողությունների տարածքը շարունակական է կամ քաղաքականությունը պետք է լինի ստոխաստիկ։