Sobes.tech
Middle — Senior

Czym jest PPO w kontekście RLHF i jak oblicza się stratę?

sobes.tech AI

Odpowiedź od AI

PPO (Proximal Policy Optimization) — to algorytm optymalizacji polityki w uczeniu ze wzmocnieniem, szeroko stosowany w RLHF (Uczenie ze wzmocnieniem z opiniami ludzkimi) do dalszego szkolenia modeli językowych z uwzględnieniem informacji zwrotnej od ludzi.

Głównym pomysłem PPO jest aktualizacja polityki tak, aby nie odchylała się zbyt mocno od obecnej, co zapobiega niestabilności uczenia. W tym celu używa się specjalnej funkcji straty, która ogranicza wielkość aktualizacji.

Strata w PPO jest zwykle obliczana jako:

L^{CLIP}(	heta) = \mathbb{E}_t \left[ \min \left( r_t(\theta) \hat{A}_t, \text{clip}(r_t(\theta), 1 - \epsilon, 1 + \epsilon) \hat{A}_t \right) \right]

gdzie:

  • $r_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}$ — stosunek prawdopodobieństw nowej i starej polityki dla działania $a_t$ w stanie $s_t$;
  • $\hat{A}_t$ — oszacowanie korzyści;
  • $\epsilon$ — hiperparametr określający dopuszczalny zakres zmian.

W ten sposób, strata karze aktualizacje, które zbyt mocno zmieniają politykę, zachowując stabilność i efektywność uczenia. W RLHF PPO jest używany do optymalizacji modelu z uwzględnieniem nagród uzyskanych od ludzkiej informacji zwrotnej.