Политика градиенти эмне жана саясат градиенти теоремасы эмне?
sobes.tech AI
AIден жооп
Policy Gradient — бул күчөтүү менен үйрөнүүдө тийиштүү стратегияны (саясатын) түздөн-түз оптималдаштыруу үчүн градиент түшүү колдонулган методдордун классы.
Маалыматтык функцияны баалоо ордуна, саясат градиенти методдору саясаттын параметрлерин жаңыртып, күтүлгөн сыйлыктарды көбөйтүүгө багытталат.
Policy Gradient Теоремасы формалдуу түрдө саясаттын параметрлери боюнча күтүлгөн сыйлыктын градиентин билдирет:
[ \nabla_\theta J(\theta) = \mathbb{E}{\pi\theta} \left[ \nabla_\theta \log \pi_\theta(a|s) Q^{\pi_\theta}(s,a) \right] ]
башкача айтканда:
- (J(\theta)) — параметрлери бар саясат менен күтүлгөн сыйлык
- (\pi_\theta(a|s)) — (s) абалында (a) аракетинин мүмкүнчүлүгү
- (Q^{\pi_\theta}(s,a)) — аракеттин баалуулук функциясы
Бул өрнөк чөйрөдөн алынган үлгүлөр аркылуу градиентти баалоого жана саясаттын параметрлерин сыйлыкты көбөйтүү багытында жаңыртууга мүмкүндүк берет.
Жөнөкөй параметрлерди жаңыртуу мисалы:
# псевдо-код
ар бир эпизод үчүн:
саясатты колдонуп траекторияны чогултуу pi_theta
ар бир (s, a, сыйлык) үчүн траекторияда:
градиент = градиент + градиент_log_pi_theta(a|s) * сыйлык
\(\theta\) жаңыртуу — үйрөнүү ылдамдыгы менен:
\(\theta = \theta + үйрөнүү ылдамдыгы * градиент\)
Policy gradient методдору кеңири колдонулат татаал стратегияларды үйрөтүүдө, өзгөчө аракеттердин кеңейиши үзгүлтүксүз болсо же саясат стокастик болушу керек болсо.