Middle — Senior
Kas yra PPO RLHF kontekste ir kaip skaičiuojama nuostolių?
sobes.tech AI
Atsakymas iš AI
PPO (Proximal Policy Optimization) — tai politikos optimizavimo algoritmas stiprinimo mokyme, plačiai naudojamas RLHF (Stiprinimo mokymas su žmogaus atsiliepimais) kontekste, siekiant toliau mokyti kalbos modelius, atsižvelgiant į žmogaus atsiliepimus.
PPO pagrindinė idėja — atnaujinti politiką taip, kad ji pernelyg nesiskirtų nuo esamos, tai užkerta kelią mokymosi nestabilumui. Tam naudojama speciali nuostolio funkcija, kuri riboja atnaujinimo dydį.
PPO dažniausiai skaičiuojama taip:
L^{CLIP}( heta) = \mathbb{E}_t \left[ \min \left( r_t(\theta) \hat{A}_t, \text{clip}(r_t(\theta), 1 - \epsilon, 1 + \epsilon) \hat{A}_t \right) \right]
kur:
- $r_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}$ — naujos ir senos politikos tikimybės santykis veiksmui $a_t$ būsenos $s_t$ metu;
- $\hat{A}_t$ — pranašumo įvertinimas;
- $\epsilon$ — hiperparametras, nustatantis leidžiamą pokyčių diapazoną.
Šiuo būdu nuostolis baudžia per daug politiką keičiančias naujoves ir taip išlaiko mokymosi stabilumą bei efektyvumą. RLHF kontekste PPO naudojamas modelio optimizavimui, atsižvelgiant į žmogaus atsiliepimų gautas premijas.