Sobes.tech
Middle — Senior

Kas yra PPO RLHF kontekste ir kaip skaičiuojama nuostolių?

sobes.tech AI

Atsakymas iš AI

PPO (Proximal Policy Optimization) — tai politikos optimizavimo algoritmas stiprinimo mokyme, plačiai naudojamas RLHF (Stiprinimo mokymas su žmogaus atsiliepimais) kontekste, siekiant toliau mokyti kalbos modelius, atsižvelgiant į žmogaus atsiliepimus.

PPO pagrindinė idėja — atnaujinti politiką taip, kad ji pernelyg nesiskirtų nuo esamos, tai užkerta kelią mokymosi nestabilumui. Tam naudojama speciali nuostolio funkcija, kuri riboja atnaujinimo dydį.

PPO dažniausiai skaičiuojama taip:

L^{CLIP}(	heta) = \mathbb{E}_t \left[ \min \left( r_t(\theta) \hat{A}_t, \text{clip}(r_t(\theta), 1 - \epsilon, 1 + \epsilon) \hat{A}_t \right) \right]

kur:

  • $r_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}$ — naujos ir senos politikos tikimybės santykis veiksmui $a_t$ būsenos $s_t$ metu;
  • $\hat{A}_t$ — pranašumo įvertinimas;
  • $\epsilon$ — hiperparametras, nustatantis leidžiamą pokyčių diapazoną.

Šiuo būdu nuostolis baudžia per daug politiką keičiančias naujoves ir taip išlaiko mokymosi stabilumą bei efektyvumą. RLHF kontekste PPO naudojamas modelio optimizavimui, atsižvelgiant į žmogaus atsiliepimų gautas premijas.