Qu'est-ce qu'un objectif coupé dans PPO?
sobes.tech IA
Réponse de l'IA
L’objectif coupé en PPO (Proximal Policy Optimization) est une méthode pour limiter les mises à jour de la politique afin d’éviter des changements trop importants qui pourraient nuire à l’apprentissage. Dans l’approche classique de mise à jour de la politique, on utilise une fonction de perte basée sur le rapport des probabilités des actions nouvelles et anciennes (ratio).
L’idée est de "recadrer" (clip) ce ratio dans l’intervalle [1 - ε, 1 + ε], où ε est un petit paramètre (par exemple, 0.2). Cela empêche une mise à jour trop forte lorsque le ratio sort de ces limites.
Formellement, la fonction de perte pour une étape:
L^{CLIP}( heta) = E_t [
min(r_t( heta) \, A_t, clip(r_t( heta), 1 - \, \\epsilon, 1 + \, \\epsilon) \, A_t)
]
où:
- r_t(θ) — rapport des probabilités de la nouvelle et de l’ancienne politique pour l’action au moment t,
- A_t — estimation de l’avantage.
Cela assure un équilibre entre exploration et stabilité de l’apprentissage, permettant d’optimiser efficacement la politique sans sauts brusques.
Ainsi, l’objectif coupé aide PPO à être un algorithme plus stable et fiable dans l’apprentissage par renforcement.