Sobes.tech
Middle — Senior

Wat is PPO in de context van RLHF en hoe wordt de loss berekend?

sobes.tech AI

Antwoord van AI

PPO (Proximal Policy Optimization) is een algoritme voor beleidsoptimalisatie in reinforcement learning, dat veel wordt gebruikt in RLHF (Reinforcement Learning with Human Feedback) om taalmodellen verder te trainen met menselijke feedback.

Het belangrijkste idee van PPO is om het beleid zo bij te werken dat het niet te veel afwijkt van het huidige beleid, wat instabiliteit tijdens het leren voorkomt. Hiervoor wordt een speciale verliesfunctie gebruikt die de grootte van de update beperkt.

De verliesfunctie in PPO wordt meestal als volgt berekend:

L^{CLIP}(	heta) = \mathbb{E}_t \left[ \min \left( r_t(\theta) \hat{A}_t, \text{clip}(r_t(\theta), 1 - \epsilon, 1 + \epsilon) \hat{A}_t \right) \right]

waar:

  • $r_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}$ — verhouding van de waarschijnlijkheden van het nieuwe en oude beleid voor actie $a_t$ in toestand $s_t$;
  • $\hat{A}_t$ — schatting van het voordeel;
  • $\epsilon$ — hyperparameter die het toegestane wijzigingsbereik bepaalt.

Op deze manier straft de verliesfunctie updates die het beleid te veel veranderen, waardoor stabiliteit en efficiëntie van het leren behouden blijven. In RLHF wordt PPO gebruikt om het model te optimaliseren met inachtneming van de beloningen die uit menselijke feedback worden verkregen.