Sobes.tech
Middle — Senior

Ce este PPO în contextul RLHF și cum se calculează pierderea?

sobes.tech AI

Răspuns de la AI

PPO (Proximal Policy Optimization) este un algoritm de optimizare a politicii în învățarea prin întărire, utilizat pe scară largă în RLHF (Învățare prin Întărire cu Feedback Uman) pentru ajustarea modelelor lingvistice ținând cont de feedback-ul uman.

Ideea principală a PPO este de a actualiza politica astfel încât să nu se îndepărteze prea mult de cea curentă, ceea ce previne instabilitatea în învățare. Pentru aceasta, se folosește o funcție de pierdere specială care limitează mărimea actualizării.

Pierdere în PPO este de obicei calculată astfel:

L^{CLIP}(	heta) = \mathbb{E}_t \left[ \min \left( r_t(\theta) \hat{A}_t, \text{clip}(r_t(\theta), 1 - \epsilon, 1 + \epsilon) \hat{A}_t \right) \right]

unde:

  • $r_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}$ — raportul probabilităților dintre politica nouă și cea veche pentru acțiunea $a_t$ în starea $s_t$;
  • $\hat{A}_t$ — estimarea avantajului;
  • $\epsilon$ — hiperparametru care stabilește intervalul permis de modificări.

Astfel, pierderea penalizează actualizările care schimbă prea mult politica, menținând stabilitatea și eficiența învățării. În RLHF, PPO este folosit pentru a optimiza modelul ținând cont de recompensele obținute din feedback-ul uman.