Sobes.tech
Middle — Senior

RLHF bağlamında PPO nedir ve kayıp nasıl hesaplanır?

sobes.tech yapay zeka

AI'dan gelen yanıt

PPO (Proximal Policy Optimization) — pekiştirmeli öğrenmede politika optimizasyonu algoritmasıdır ve RLHF (İnsan Geri Bildirimi ile Pekiştirmeli Öğrenme) kapsamında dil modellerini insan geri bildirimlerini dikkate alarak yeniden eğitmek için yaygın olarak kullanılır.

PPO'nun temel fikri, politikayı mevcut durumdan çok uzaklaşmadan güncellemektir, bu da eğitimde istikrarsızlığı önler. Bunun için, güncellemeyi sınırlayan özel bir kayıp fonksiyonu kullanılır.

PPO'da kayıp genellikle şu şekilde hesaplanır:

L^{CLIP}(	heta) = \mathbb{E}_t \left[ \min \left( r_t(\theta) \hat{A}_t, \text{clip}(r_t(\theta), 1 - \epsilon, 1 + \epsilon) \hat{A}_t \right) \right]

burada:

  • $r_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}$ — yeni ve eski politika olasılıklarının oranı;
  • $\hat{A}_t$ — avantaj tahmini;
  • $\epsilon$ — izin verilen değişiklik aralığını belirleyen hiperparametre.

Bu şekilde, kayıp, politikayı çok fazla değiştiren güncellemeleri cezalandırır ve böylece eğitimde istikrar ve verimlilik korunur. RLHF'de PPO, insan geri bildiriminden alınan ödülleri dikkate alarak modeli optimize etmek için kullanılır.