Sobes.tech
Middle — Senior

PPOдогу кесилген максат деген эмне?

sobes.tech AI

AIден жооп

PPO (Proximal Policy Optimization) ичиндеги clipped objective — саясатты жаңылоону чектөөчү ыкма, ал өтө чоң өзгөрүүлөрдүн алдын алат жана үйрөнүүнү жакшыртат. Классикалык саясат жаңылоо ыкмасында, жаңы жана эски аракеттердин ыктымалдуулук катышы (ratio) негизделген жоготуу функциясы колдонулат.

Идея — бул катышты [1 - ε, 1 + ε] интервалында "кесүү" (clip), анда ε — кичинекей параметр (мисалы, 0.2). Бул катыш өтө чектен чыгып кетпеши үчүн алдын алат.

Расмий түрдө, бир кадам үчүн жоготуу функциясы:

L^{CLIP}(	heta) = E_t [
  min(r_t(	heta) \, A_t, clip(r_t(	heta), 1 - \, \\epsilon, 1 + \, \\epsilon) \, A_t)
]

мында:

  • r_t(θ) — t убакта жаңы жана эски саясаттын ыктымалдуулук катышы,
  • A_t — артыкчылык баалоо.

Бул изилдөө менен туруктуулуктун ортосунда баланс камсыз кылат жана саясатты натыйжалуу оптималдаштырууга мүмкүндүк берет, күтүүсүз өзгөрүүлөрсүз.

Ошентип, clipped objective PPO'ну көбүрөөк туруктуу жана ишенимдүү алгоритм кылууга жардам берет, күчөтүлгөн үйрөнүүдө.