Šta je PPO u kontekstu RLHF i kako se računa gubitak?
sobes.tech АИ
Одговор од АИ
PPO (Proximal Policy Optimization) je algoritam za optimizaciju politike u učenju putem pojačanja, široko korišćen u RLHF (Učenje putem pojačanja sa ljudskom povratnom informacijom) za dodatno treniranje jezičkih modela uzimajući u obzir ljudsku povratnu informaciju.
Glavna ideja PPO je da ažurira politiku tako da se ne udaljava previše od trenutne, čime se sprečava nestabilnost u učenju. Za to se koristi specijalna funkcija gubitka koja ograničava veličinu ažuriranja.
Gubitak u PPO se obično računa na sledeći način:
L^{CLIP}( heta) = \mathbb{E}_t \left[ \min \left( r_t(\theta) \hat{A}_t, \text{clip}(r_t(\theta), 1 - \epsilon, 1 + \epsilon) \hat{A}_t \right) \right]
gde:
- $r_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}$ — odnos verovatnoća nove i stare politike za akciju $a_t$ u stanju $s_t$;
- $\hat{A}_t$ — procena prednosti;
- $\epsilon$ — hiperparametar koji određuje dozvoljeni opseg promena.
Na ovaj način, gubitak kažnjava ažuriranja koja previše menjaju politiku, održavajući stabilnost i efikasnost učenja. U RLHF, PPO se koristi za optimizaciju modela uzimajući u obzir nagrade dobijene od ljudske povratne informacije.