Sobes.tech
Middle — Senior

Šta je PPO u kontekstu RLHF i kako se računa gubitak?

sobes.tech АИ

Одговор од АИ

PPO (Proximal Policy Optimization) je algoritam za optimizaciju politike u učenju putem pojačanja, široko korišćen u RLHF (Učenje putem pojačanja sa ljudskom povratnom informacijom) za dodatno treniranje jezičkih modela uzimajući u obzir ljudsku povratnu informaciju.

Glavna ideja PPO je da ažurira politiku tako da se ne udaljava previše od trenutne, čime se sprečava nestabilnost u učenju. Za to se koristi specijalna funkcija gubitka koja ograničava veličinu ažuriranja.

Gubitak u PPO se obično računa na sledeći način:

L^{CLIP}(	heta) = \mathbb{E}_t \left[ \min \left( r_t(\theta) \hat{A}_t, \text{clip}(r_t(\theta), 1 - \epsilon, 1 + \epsilon) \hat{A}_t \right) \right]

gde:

  • $r_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}$ — odnos verovatnoća nove i stare politike za akciju $a_t$ u stanju $s_t$;
  • $\hat{A}_t$ — procena prednosti;
  • $\epsilon$ — hiperparametar koji određuje dozvoljeni opseg promena.

Na ovaj način, gubitak kažnjava ažuriranja koja previše menjaju politiku, održavajući stabilnost i efikasnost učenja. U RLHF, PPO se koristi za optimizaciju modela uzimajući u obzir nagrade dobijene od ljudske povratne informacije.