¿Qué es PPO en el contexto de RLHF y cómo se calcula la pérdida?
sobes.tech AI
Respuesta de la IA
PPO (Optimización de Políticas Proximal) es un algoritmo de optimización de políticas en aprendizaje por refuerzo, ampliamente utilizado en RLHF (Aprendizaje por Refuerzo con Retroalimentación Humana) para ajustar modelos de lenguaje teniendo en cuenta la retroalimentación humana.
La idea principal de PPO es actualizar la política de manera que no se desvíe demasiado de la actual, lo que previene la inestabilidad en el entrenamiento. Para ello, se utiliza una función de pérdida especial que limita la magnitud de la actualización.
La pérdida en PPO generalmente se calcula como:
L^{CLIP}( heta) = \mathbb{E}_t \left[ \min \left( r_t(\theta) \hat{A}_t, \text{clip}(r_t(\theta), 1 - \epsilon, 1 + \epsilon) \hat{A}_t \right) \right]
donde:
- $r_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}$ — relación de probabilidades de la política nueva y la antigua para la acción $a_t$ en el estado $s_t$;
- $\hat{A}_t$ — estimación de la ventaja;
- $\epsilon$ — hiperparámetro que define el rango permitido de cambios.
De esta forma, la pérdida penaliza las actualizaciones que cambian demasiado la política, manteniendo la estabilidad y eficiencia del entrenamiento. En RLHF, PPO se usa para optimizar el modelo considerando las recompensas obtenidas de la retroalimentación humana.