Sobes.tech
Middle — Senior

PPO da clipped objective nima?

sobes.tech AI

AIdan javob

PPO (Proximal Policy Optimization) da clipped objective — bu siyosatni yangilashni cheklash usuli bo‘lib, juda katta o‘zgarishlarni oldini oladi, bu esa o‘qitishni yomonlashtirishi mumkin. An’anaviy siyosatni yangilash yondashuvida, yangi va eski harakatlarning ehtimollik nisbati (ratio) asosida yo‘qotish funktsiyasi ishlatiladi.

G‘oya shundaki, bu nisbatni [1 - ε, 1 + ε] oralig‘ida "kesish" (clip) qilish, bu yerda ε — kichik parametr (masalan, 0.2). Bu nisbat bu chegaralarni oshib ketganda juda kuchli yangilanishlarni oldini oladi.

Rasmiy ravishda, bir qadam uchun yo‘qotish funktsiyasi:

L^{CLIP}(	heta) = E_t [
  min(r_t(	heta) \, A_t, clip(r_t(	heta), 1 - \, \\epsilon, 1 + \, \\epsilon) \, A_t)
]

bu yerda:

  • r_t(θ) — t da yangi va eski siyosat ehtimolliklarining nisbati,
  • A_t — afzallikning bahosi.

Bu eksploratsiya va barqarorlik o‘rtasida muvozanatni ta’minlaydi va siyosatni samarali optimallashtirishga imkon beradi, keskin o‘tishlarsiz.

Shu sababli, clipped objective PPO ni yanada barqaror va ishonchli qilishga yordam beradi.