Ce este PPO în contextul RLHF și cum se calculează pierderea?
sobes.tech AI
Răspuns de la AI
PPO (Proximal Policy Optimization) este un algoritm de optimizare a politicii în învățarea prin întărire, utilizat pe scară largă în RLHF (Învățare prin Întărire cu Feedback Uman) pentru ajustarea modelelor lingvistice ținând cont de feedback-ul uman.
Ideea principală a PPO este de a actualiza politica astfel încât să nu se îndepărteze prea mult de cea curentă, ceea ce previne instabilitatea în învățare. Pentru aceasta, se folosește o funcție de pierdere specială care limitează mărimea actualizării.
Pierdere în PPO este de obicei calculată astfel:
L^{CLIP}( heta) = \mathbb{E}_t \left[ \min \left( r_t(\theta) \hat{A}_t, \text{clip}(r_t(\theta), 1 - \epsilon, 1 + \epsilon) \hat{A}_t \right) \right]
unde:
- $r_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}$ — raportul probabilităților dintre politica nouă și cea veche pentru acțiunea $a_t$ în starea $s_t$;
- $\hat{A}_t$ — estimarea avantajului;
- $\epsilon$ — hiperparametru care stabilește intervalul permis de modificări.
Astfel, pierderea penalizează actualizările care schimbă prea mult politica, menținând stabilitatea și eficiența învățării. În RLHF, PPO este folosit pentru a optimiza modelul ținând cont de recompensele obținute din feedback-ul uman.