Какво е PPO в контекста на RLHF и как се изчислява загубата?
sobes.tech AI
Отговор от AI
PPO (Proximal Policy Optimization) е алгоритъм за оптимизация на политика в обучението с подсилване, широко използван в RLHF (Обучение с подсилване с човешка обратна връзка) за допълнително обучение на езикови модели, като взема предвид човешката обратна връзка.
Основната идея на PPO е да актуализира политиката така, че да не се отклонява твърде много от текущата, което предотвратява нестабилност при обучението. За това се използва специална функция за загуба, която ограничава големината на актуализацията.
Загубата в PPO обикновено се изчислява по следния начин:
L^{CLIP}( heta) = \mathbb{E}_t \left[ \min \left( r_t(\theta) \hat{A}_t, \text{clip}(r_t(\theta), 1 - \epsilon, 1 + \epsilon) \hat{A}_t \right) \right]
където:
- $r_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}$ — съотношението на вероятностите на новата и старата политика за действие $a_t$ в състояние $s_t$;
- $\hat{A}_t$ — оценка на предимството;
- $\epsilon$ — хиперпараметър, който определя допустимия диапазон на промени.
По този начин, загубата наказва актуализации, които твърде много променят политиката, като запазва стабилността и ефективността на обучението. В RLHF, PPO се използва за оптимизация на модела, като взема предвид наградите, получени от човешката обратна връзка.