Sobes.tech
Middle — Senior

Co je to clipped objective v PPO?

sobes.tech AI

Odpověď od AI

Cílová funkce s oříznutím v PPO (Proximal Policy Optimization) je způsob, jak omezit aktualizace politiky, aby se zabránilo příliš velkým změnám, které by mohly zhoršit učení. V klasickém přístupu k aktualizaci politiky se používá ztrátová funkce založená na poměru pravděpodobností nových a starých akcí (ratio).

Myšlenka je "oříznout" (clip) tento poměr v rozmezí [1 - ε, 1 + ε], kde ε je malý parametr (například 0.2). To zabraňuje příliš silným aktualizacím, když poměr překročí tyto hranice.

Formálně, ztrátová funkce pro jeden krok:

L^{CLIP}(	heta) = E_t [
  min(r_t(	heta) \, A_t, clip(r_t(	heta), 1 - \, \\epsilon, 1 + \, \\epsilon) \, A_t)
]

kde:

  • r_t(θ) — poměr pravděpodobností nové a staré politiky pro akci v čase t,
  • A_t — odhad výhody.

Toto zajišťuje rovnováhu mezi průzkumem a stabilitou učení, umožňuje efektivně optimalizovat politiku bez prudkých skoků.

Tedy, oříznutý cíl pomáhá PPO být stabilnějším a spolehlivějším algoritmem v posilovaném učení.