Qu'est-ce que PPO dans le contexte de RLHF et comment la perte est-elle calculée?
sobes.tech IA
Réponse de l'IA
PPO (Proximal Policy Optimization) est un algorithme d'optimisation de politique en apprentissage par renforcement, largement utilisé dans RLHF (Apprentissage par Renforcement avec Feedback Humain) pour affiner les modèles linguistiques en tenant compte du retour d'information humain.
L'idée principale de PPO est de mettre à jour la politique de manière à ne pas s'en éloigner trop, ce qui évite l'instabilité de l'apprentissage. Pour cela, une fonction de perte spéciale est utilisée pour limiter la taille de la mise à jour.
La perte dans PPO est généralement calculée comme suit :
L^{CLIP}( heta) = \mathbb{E}_t \left[ \min \left( r_t(\theta) \hat{A}_t, \text{clip}(r_t(\theta), 1 - \epsilon, 1 + \epsilon) \hat{A}_t \right) \right]
où :
- $r_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}$ — rapport des probabilités de la nouvelle et de l'ancienne politique pour l'action $a_t$ dans l'état $s_t$;
- $\hat{A}_t$ — estimation de l'avantage;
- $\epsilon$ — hyperparamètre qui définit la plage de changements autorisés.
Ainsi, la perte pénalise les mises à jour qui modifient trop la politique, en maintenant la stabilité et l'efficacité de l'apprentissage. En RLHF, PPO est utilisé pour optimiser le modèle en tenant compte des récompenses obtenues à partir du retour d'information humain.