Was ist PPO im Kontext von RLHF und wie wird der Verlust berechnet?
sobes.tech KI
Antwort von AI
PPO (Proximal Policy Optimization) ist ein Algorithmus zur Politikoptimierung im Reinforcement Learning, der im RLHF (Reinforcement Learning with Human Feedback) weit verbreitet ist, um Sprachmodelle unter Berücksichtigung menschlichen Feedbacks nachzutrainieren.
Die Hauptidee von PPO ist es, die Politik so zu aktualisieren, dass sie sich nicht zu stark von der aktuellen unterscheidet, was die Stabilität des Lernprozesses verhindert. Dafür wird eine spezielle Verlustfunktion verwendet, die die Größe der Aktualisierung begrenzt.
Der Verlust in PPO wird üblicherweise wie folgt berechnet:
L^{CLIP}( heta) = \mathbb{E}_t \left[ \min \left( r_t(\theta) \hat{A}_t, \text{clip}(r_t(\theta), 1 - \epsilon, 1 + \epsilon) \hat{A}_t \right) \right]
wobei:
- $r_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}$ — das Verhältnis der Wahrscheinlichkeiten der neuen und alten Politik für die Aktion $a_t$ im Zustand $s_t$;
- $\hat{A}_t$ — Schätzung des Vorteils;
- $\epsilon$ — Hyperparameter, der den zulässigen Änderungsbereich festlegt.
Auf diese Weise bestraft der Verlust Aktualisierungen, die die Politik zu stark verändern, und erhält so die Stabilität und Effizienz des Lernprozesses. Im RLHF wird PPO verwendet, um das Modell unter Berücksichtigung der von menschlichem Feedback erhaltenen Belohnungen zu optimieren.