Sobes.tech
Middle — Senior

O que é um objetivo cortado no PPO?

sobes.tech IA

Resposta da IA

Clipped objective no PPO (Proximal Policy Optimization) é uma forma de limitar as atualizações da política para evitar mudanças demasiado grandes que possam prejudicar o treino. Na abordagem clássica de atualização de política, usa-se uma função de perda baseada na relação de probabilidades de ações novas e antigas (ratio).

A ideia é "recortar" (clip) essa relação dentro do intervalo [1 - ε, 1 + ε], onde ε é um parâmetro pequeno (por exemplo, 0.2). Isso impede uma atualização demasiado forte quando a relação sai desses limites.

Formalmente, a função de perda para um passo:

L^{CLIP}(	heta) = E_t [
  min(r_t(	heta) \, A_t, clip(r_t(	heta), 1 - \, \\epsilon, 1 + \, \\epsilon) \, A_t)
]

onde:

  • r_t(θ) — relação de probabilidades da política nova e antiga para a ação no momento t,
  • A_t — estimativa da vantagem.

Isto garante um equilíbrio entre exploração e estabilidade no treino, permitindo otimizar a política de forma eficaz sem saltos bruscos.

Assim, o objetivo recortado ajuda o PPO a ser um algoritmo mais estável e confiável no aprendizado por reforço.