Czym jest PPO w kontekście RLHF i jak oblicza się stratę?
sobes.tech AI
Odpowiedź od AI
PPO (Proximal Policy Optimization) — to algorytm optymalizacji polityki w uczeniu ze wzmocnieniem, szeroko stosowany w RLHF (Uczenie ze wzmocnieniem z opiniami ludzkimi) do dalszego szkolenia modeli językowych z uwzględnieniem informacji zwrotnej od ludzi.
Głównym pomysłem PPO jest aktualizacja polityki tak, aby nie odchylała się zbyt mocno od obecnej, co zapobiega niestabilności uczenia. W tym celu używa się specjalnej funkcji straty, która ogranicza wielkość aktualizacji.
Strata w PPO jest zwykle obliczana jako:
L^{CLIP}( heta) = \mathbb{E}_t \left[ \min \left( r_t(\theta) \hat{A}_t, \text{clip}(r_t(\theta), 1 - \epsilon, 1 + \epsilon) \hat{A}_t \right) \right]
gdzie:
- $r_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}$ — stosunek prawdopodobieństw nowej i starej polityki dla działania $a_t$ w stanie $s_t$;
- $\hat{A}_t$ — oszacowanie korzyści;
- $\epsilon$ — hiperparametr określający dopuszczalny zakres zmian.
W ten sposób, strata karze aktualizacje, które zbyt mocno zmieniają politykę, zachowując stabilność i efektywność uczenia. W RLHF PPO jest używany do optymalizacji modelu z uwzględnieniem nagród uzyskanych od ludzkiej informacji zwrotnej.