Sobes.tech
Middle — Senior

PPO дар контексти RLHF чист ва чӣ гуна ҳисоб карда мешавад loss?

sobes.tech AI

Ҷавоб аз AI

PPO (Proximal Policy Optimization) — алгоритми беҳтаргардонии сиёсати дар омӯзиши бо такрор, ки дар RLHF (Омӯзиши бо такрор бо фикри инсон) барои такмили моделҳои забонӣ бо назардошти фикри инсон васеъ истифода мешавад.

Асосии идеяи PPO — навсозии сиёсати тавре ки аз сиёсати ҳозира зиёд фарқ накунад, ки ин пешгирии номуайянӣ дар омӯзишро таъмин мекунад. Барои ин, функсияи махсуси зиён истифода мешавад, ки андозаи навсозиро маҳдуд мекунад.

Зиён дар PPO одатан чунин ҳисоб карда мешавад:

L^{CLIP}(	heta) = \mathbb{E}_t \left[ \min \left( r_t(\theta) \hat{A}_t, \text{clip}(r_t(\theta), 1 - \epsilon, 1 + \epsilon) \hat{A}_t \right) \right]

ки дар он:

  • $r_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}$ — нисбати эҳтимолиятҳои сиёсати нав ва кӯҳна барои амал $a_t$ дар ҳолати $s_t$;
  • $\hat{A}_t$ — тахминии манфиат;
  • $\epsilon$ — гиперпараметр, ки доираи иҷозатдодашударо муайян мекунад.

Бинобар ин, зиён навсозиро, ки сиёсати зиёд тағйир медиҳад, ҷазо медиҳад ва ҳамин тариқ, устуворӣ ва самаранокии омӯзишро нигоҳ медорад. Дар RLHF, PPO барои оптимизатсияи модел бо назардошти ҷоизаҳо, ки аз фикри инсон гирифта шудаанд, истифода мешавад.