Sobes.tech
Middle — Senior

Czym jest przycięty cel w PPO?

sobes.tech AI

Odpowiedź od AI

Clipped objective w PPO (Proximal Policy Optimization) to sposób na ograniczenie aktualizacji polityki, aby uniknąć zbyt dużych zmian, które mogą pogorszyć proces uczenia. W klasycznym podejściu do aktualizacji polityki używa się funkcji straty opartej na stosunku prawdopodobieństw nowych i starych działań (ratio).

Idea polega na "przycięciu" (clip) tego stosunku w zakresie [1 - ε, 1 + ε], gdzie ε jest małym parametrem (np. 0.2). Zapobiega to zbyt silnej aktualizacji, gdy stosunek wykracza poza te granice.

Formalnie, funkcja straty dla jednego kroku:

L^{CLIP}(	heta) = E_t [
  min(r_t(	heta) \, A_t, clip(r_t(	heta), 1 - \, \\epsilon, 1 + \, \\epsilon) \, A_t)
]

gdzie:

  • r_t(θ) — stosunek prawdopodobieństw nowej i starej polityki dla działania w czasie t,
  • A_t — oszacowanie korzyści (advantage).

To zapewnia równowagę między eksploracją a stabilnością uczenia, umożliwiając efektywną optymalizację polityki bez nagłych skoków.

W związku z tym, clipped objective pomaga PPO być bardziej stabilnym i niezawodnym algorytmem w uczeniu ze wzmocnieniem.