პოლიტიკის გრადიენტი რა არის და რა ამბობს პოლიტიკის გრადიენტის თეორემა?
sobes.tech AI
პასუხი AI-სგან
Policy Gradient — бул күчөтүү менен үйрөнүүдө тийиштүү стратегияны (саясатын) түздөн-түз оптималдаштыруу үчүн градиент түшүүнү колдонгон методдордун классы.
Баалуулук функциясын баалоо ордуна, саясат градиенти методдору саясаттын параметрлерин жаңыртып, күтүлгөн сыйлыктарды көбөйтүүгө багытталат.
Policy Gradient Теоремасы формалдуу түрдө саясаттын параметрлери боюнча күтүлгөн сыйлыктын градиентин билдирет:
[ \nabla_\theta J(\theta) = \mathbb{E}{\pi\theta} \left[ \nabla_\theta \log \pi_\theta(a|s) Q^{\pi_\theta}(s,a) \right] ]
башкача айтканда:
- (J(\theta)) — параметрлери бар саясат менен күтүлгөн сыйлык
- (\pi_\theta(a|s)) — (s) абалында (a) аракетинин мүмкүнчүлүгү
- (Q^{\pi_\theta}(s,a)) — аракеттин баалуулук функциясы
Бул өрнөк чөйрөдөн алынган үлгүлөр аркылуу градиентти баалоого жана саясаттын параметрлерин сыйлыкты көбөйтүү багытында жаңыртууга мүмкүндүк берет.
Жөнөкөй параметрлерди жаңыртуу мисалы:
# псевдо-код
ар бир эпизод үчүн:
саясатты колдонуп траекторияны чогултуу pi_theta
ар бир (s, a, сыйлык) үчүн траекторияда:
градиент = градиент + градиент_log_pi_theta(a|s) * сыйлык
\(\theta\) жаңыртуу — үйрөнүү ылдамдыгы менен:
\(\theta = \theta + үйрөнүү ылдамдыгы * градиент\)
Policy gradient методдору кеңири колдонулат татаал стратегияларды үйрөтүүдө, өзгөчө аракеттердин кеңейиши үзгүлтүксүз болсо же саясат стокастик болушу керек болсо.