Čo je PPO v kontexte RLHF a ako sa počíta strata?
sobes.tech AI
Odpoveď od AI
PPO (Proximal Policy Optimization) je algoritmus pre optimizácie politiky v posilňovacom učení, ktorý sa široko používa v RLHF (Posilňovacie učenie s ľudskou spätnou väzbou) na ďalšie trénovanie jazykových modelov s prihliadnutím na ľudskú spätnú väzbu.
Hlavná myšlienka PPO je aktualizovať politiku tak, aby sa príliš neodkláňala od súčasnej, čím sa zabraňuje nestabilite učenia. Na tento účel sa používa špeciálna funkcia straty, ktorá obmedzuje veľkosť aktualizácie.
Strata v PPO sa zvyčajne počíta takto:
L^{CLIP}( heta) = \mathbb{E}_t \left[ \min \left( r_t(\theta) \hat{A}_t, \text{clip}(r_t(\theta), 1 - \epsilon, 1 + \epsilon) \hat{A}_t \right) \right]
kde:
- $r_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}$ — pomer pravdepodobností novej a starej politiky pre akciu $a_t$ v stave $s_t$;
- $\hat{A}_t$ — odhad výhody;
- $\epsilon$ — hyperparameter, ktorý určuje povolený rozsah zmien.
Týmto spôsobom strata penalizuje aktualizácie, ktoré príliš menia politiku, a tým udržiava stabilitu a efektívnosť učenia. V RLHF sa PPO používa na optimalizáciu modelu s prihliadnutím na odmeny získané z ľudskej spätné väzby.