Sobes.tech
Middle — Senior

O que é PPO no contexto de RLHF e como é calculada a loss?

sobes.tech IA

Resposta da IA

PPO (Proximal Policy Optimization) é um algoritmo de otimização de política em aprendizagem por reforço, amplamente utilizado em RLHF (Aprendizagem por Reforço com Feedback Humano) para ajustar modelos de linguagem considerando o feedback humano.

A ideia principal do PPO é atualizar a política de modo que ela não se desvie demasiado da atual, o que previne a instabilidade no treinamento. Para isso, é usada uma função de perda especial que limita a magnitude da atualização.

A perda no PPO geralmente é calculada como:

L^{CLIP}(	heta) = \mathbb{E}_t \left[ \min \left( r_t(\theta) \hat{A}_t, \text{clip}(r_t(\theta), 1 - \epsilon, 1 + \epsilon) \hat{A}_t \right) \right]

onde:

  • $r_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}$ — relação de probabilidades da nova e antiga política para a ação $a_t$ no estado $s_t$;
  • $\hat{A}_t$ — estimativa da vantagem;
  • $\epsilon$ — hiperparâmetro que define o intervalo permitido de mudanças.

Dessa forma, a perda penaliza atualizações que mudam demais a política, mantendo a estabilidade e eficiência do treinamento. No RLHF, PPO é usado para otimizar o modelo considerando as recompensas obtidas do feedback humano.