Middle — Senior
Co je PPO v kontextu RLHF a jak se počítá ztráta?
sobes.tech AI
Odpověď od AI
PPO (Proximal Policy Optimization) je algoritmus pro optimalizaci politiky v posilovacím učení, který se široce používá v RLHF (Posilovací učení s lidskou zpětnou vazbou) k dalšímu tréninku jazykových modelů s ohledem na lidskou zpětnou vazbu.
Hlavní myšlenkou PPO je aktualizovat politiku tak, aby se příliš nezměnila od současné, což zabraňuje nestabilitě učení. K tomu se používá speciální funkce ztráty, která omezuje velikost aktualizace.
Ztráta v PPO se obvykle počítá takto:
L^{CLIP}( heta) = \mathbb{E}_t \left[ \min \left( r_t(\theta) \hat{A}_t, \text{clip}(r_t(\theta), 1 - \epsilon, 1 + \epsilon) \hat{A}_t \right) \right]
kde:
- $r_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}$ — poměr pravděpodobností nové a staré politiky pro akci $a_t$ ve stavu $s_t$;
- $\hat{A}_t$ — odhad výhody;
- $\epsilon$ — hyperparametr, který určuje povolený rozsah změn.
Tímto způsobem penalizuje ztráta aktualizace, které příliš mění politiku, a tím udržuje stabilitu a efektivitu učení. V RLHF se PPO používá k optimalizaci modelu s ohledem na odměny získané z lidské zpětné vazby.