Sobes.tech
Middle — Senior

Čo je to clipped objective v PPO?

sobes.tech AI

Odpoveď od AI

Cieľová funkcia s orezaním v PPO (Proximal Policy Optimization) je spôsob, ako obmedziť aktualizácie politiky, aby sa predišlo príliš veľkým zmenám, ktoré by mohli zhoršiť učenie. V klasickom prístupe k aktualizácii politiky sa používa funkcia straty založená na pomere pravdepodobností nových a starých akcií (ratio).

Myšlienka je "orezať" (clip) tento pomer v rozmedzí [1 - ε, 1 + ε], kde ε je malý parameter (napríklad 0.2). To zabraňuje príliš silným aktualizáciám, keď pomer prekročí tieto hranice.

Formálne, funkcia straty pre jeden krok:

L^{CLIP}(	heta) = E_t [
  min(r_t(	heta) \, A_t, clip(r_t(	heta), 1 - \, \\epsilon, 1 + \, \\epsilon) \, A_t)
]

kde:

  • r_t(θ) — pomer pravdepodobností novej a starej politiky pre akciu v čase t,
  • A_t — odhad výhody.

Toto zabezpečuje rovnováhu medzi prieskumom a stabilitou učenia, umožňujúc efektívnu optimalizáciu politiky bez prudkých skokov.

Takto orezaný cieľ pomáha PPO byť stabilnejším a spoľahlivejším algoritmom v posilňovanom učení.