PPO'da clipped objective nedir?
sobes.tech yapay zeka
AI'dan gelen yanıt
PPO (Proximal Policy Optimization) içindeki clipped objective, politikayı güncellemeleri sınırlandırmak için kullanılan bir yöntemdir; böylece çok büyük değişiklikler yapılarak eğitim bozulmaz. Geleneksel politika güncelleme yaklaşımında, yeni ve eski eylemlerin olasılık oranına dayanan bir kayıp fonksiyonu kullanılır (oran).
Fikir, bu oranı [1 - ε, 1 + ε] aralığında "kırpmak" (clip) ve ε’nin küçük bir parametre olması (örneğin 0.2). Bu, oran bu sınırların dışına çıktığında aşırı güncellemeleri engeller.
Resmi olarak, bir adım için kayıp fonksiyonu:
L^{CLIP}( heta) = E_t [
min(r_t( heta) \, A_t, clip(r_t( heta), 1 - \, \\epsilon, 1 + \, \\epsilon) \, A_t)
]
Burada:
- r_t(θ) — t anındaki yeni ve eski politika olasılıklarının oranı,
- A_t — avantaj tahmini.
Bu, keşif ve öğrenmenin istikrarı arasında denge sağlar ve politikayı etkili bir şekilde optimize etmeye olanak tanır, ani sıçramalar olmadan.
Bu nedenle, clipped objective PPO’nun daha stabil ve güvenilir bir takviye öğrenme algoritması olmasına yardımcı olur.