Sobes.tech
Middle — Senior

Какво е policy gradient и какво гласи теоремата за policy gradient?

sobes.tech AI

Отговор от AI

Policy Gradient е клас методи в обучение с подкрепа, които директно оптимизират параметричната стратегия (политика), използвайки градиентен спуск.

Вместо да оценяват функцията на стойността, методите на policy gradient актуализират параметрите на политиката, за да увеличат очакваното възнаграждение.

Теоремата за Policy Gradient формално изразява градиента на очакваното възнаграждение по отношение на параметрите на политиката:

[ \nabla_\theta J(\theta) = \mathbb{E}{\pi\theta} \left[ \nabla_\theta \log \pi_\theta(a|s) Q^{\pi_\theta}(s,a) \right] ]

където:

  • (J(\theta)) — очаквано възнаграждение с политика с параметри (\theta)
  • (\pi_\theta(a|s)) — вероятността за действие (a) в състояние (s)
  • (Q^{\pi_\theta}(s,a)) — функция на стойността на действието

Това изразяване позволява оценка на градиента с помощта на проби от средата и актуализиране на параметрите на политиката в посока на увеличаване на наградата.

Пример за просто обновяване на параметрите:

# псевдо-код
за всеки епизод:
    събиране на траектория с помощта на политика pi_theta
    за всяко (s, a, награда) в траекторията:
        градиент = градиент + градиент_log_pi_theta(a|s) * награда
    theta = theta + скорост_на_обучение * градиент

Методите на policy gradient се използват широко за обучение на сложни стратегии, особено когато пространството на действията е непрекъснато или политиката трябва да бъде стохастична.