Sobes.tech
Middle — Senior

¿Qué es un objetivo recortado en PPO?

sobes.tech AI

Respuesta de la IA

Clipped objective en PPO (Proximal Policy Optimization) es una forma de limitar las actualizaciones de la política para evitar cambios demasiado grandes que puedan perjudicar el entrenamiento. En el enfoque clásico de actualización de políticas, se utiliza una función de pérdida basada en la relación de probabilidades de las acciones nuevas y antiguas (ratio).

La idea es "recortar" (clip) esta relación dentro del intervalo [1 - ε, 1 + ε], donde ε es un parámetro pequeño (por ejemplo, 0.2). Esto previene una actualización demasiado fuerte cuando la relación sale de estos límites.

Formalmente, la función de pérdida para un paso:

L^{CLIP}(	heta) = E_t [
  min(r_t(	heta) \, A_t, clip(r_t(	heta), 1 - \, \\epsilon, 1 + \, \\epsilon) \, A_t)
]

donde:

  • r_t(θ) — relación de probabilidades de la política nueva y antigua para la acción en el momento t,
  • A_t — estimación de la ventaja (advantage).

Esto asegura un equilibrio entre exploración y estabilidad en el entrenamiento, permitiendo optimizar la política de manera efectiva sin saltos bruscos.

Por lo tanto, el objetivo recortado ayuda a que PPO sea un algoritmo más estable y confiable en el aprendizaje por refuerzo.