Gradient-и сиёсӣ чист ва теоремаи gradient-и сиёсӣ чист?
sobes.tech AI
Ҷавоб аз AI
Policy Gradient як класи методів у навчанні з підкріпленням, які безпосередньо оптимізують параметричну стратегію (політику), використовуючи градієнтний спуск.
Замість оцінки функції цінності, методи policy gradient оновлюють параметри політики так, щоб збільшити очікувану винагороду.
Теорема Policy Gradient формально виражає градієнт очікуваної винагороди щодо параметрів політики:
[ \nabla_\theta J(\theta) = \mathbb{E}{\pi\theta} \left[ \nabla_\theta \log \pi_\theta(a|s) Q^{\pi_\theta}(s,a) \right] ]
де:
- (J(\theta)) — очікувана винагорода з політики з параметрами (\theta)
- (\pi_\theta(a|s)) — ймовірність дії (a) у стані (s)
- (Q^{\pi_\theta}(s,a)) — функція цінності дії
Цей вираз дозволяє оцінювати градієнт за допомогою зразків із середовища і оновлювати параметри політики у напрямку збільшення винагороди.
Приклад простої оновлення параметрів:
# псевдокод
для кожної епізоду:
зібрати траєкторію, використовуючи політику pi_theta
для кожної (s, a, винагорода) у траєкторії:
градієнт = градієнт + градієнт_log_pi_theta(a|s) * винагорода
theta = theta + швидкість_навчання * градієнт
Методи policy gradient широко застосовуються для навчання складних стратегій, особливо коли простір дій є безперервним або політика має бути стохастичною.