Ի՞նչ է քաղաքականության գրաֆիկը և ինչ է ասում քաղաքականության գրաֆիկի տեսությունը։
sobes.tech AI
Պատասխան AI-ից
Policy Gradient-ը դաս է մեթոդների, որոնք ուղղակիորեն օպտիմալացնում են պարամետրային ռազմավարությունը (պոլիտիկան) օգտագործելով գրադիենտային իջեցում:
Ի տարբերություն արժեքի ֆունկցիայի գնահատման, policy gradient մեթոդները թարմացնում են քաղաքականության պարամետրերը՝ բարձրացնելու սպասվող պարգևը:
Policy Gradient-ի Թեորեմը պաշտոնապես արտահայտում է սպասվող պարգևի գրադիենտը քաղաքականության պարամետրերի նկատմամբ՝
[ \nabla_\theta J(\theta) = \mathbb{E}{\pi\theta} \left[ \nabla_\theta \log \pi_\theta(a|s) Q^{\pi_\theta}(s,a) \right] ]
որտեղ՝
- (J(\theta)) — սպասվող պարգևը պարամետրային քաղաքականությամբ, որը նշվում է (\theta)
- (\pi_\theta(a|s)) — հավանականությունը գործողության (a)՝ վիճակում (s)
- (Q^{\pi_\theta}(s,a)) — գործողության արժեքային ֆունկցիա
Այս արտահայտությունը թույլ է տալիս գնահատել գրադիենտը միջավայրից վերցված նմուշների միջոցով և թարմացնել քաղաքականության պարամետրերը՝ պարգևը բարձրացնելու ուղղությամբ:
Պարզ պարամետրային թարմացման օրինակ՝
# սիմվոլիկ կոդ
յուրաքանչյուր էպիզոդի համար՝
հավաքել տրեյլի օգտագործելով policy pi_theta
յուրաքանչյուր (s, a, պարգև) տրեյլում՝
գրադիենտ = գրադիենտ + գրադիենտ_log_pi_theta(a|s) * պարգև
\(\theta\) թարմացնել՝ ուսուցման արագությամբ՝
\(\theta = \theta + \text{ուսուցման արագություն} * \text{գրադիենտ}\)
Policy gradient մեթոդները լայնորեն կիրառվում են բարդ ռազմավարությունների ուսուցման համար, հատկապես երբ գործողությունների տարածքը շարունակական է կամ քաղաքականությունը պետք է լինի ստոխաստիկ։