Sobes.tech
Middle — Senior

Ինչ է PPO-ը RLHF կոնտեքստում և ինչպես է հաշվարկվում կորուստը?

sobes.tech AI

Պատասխան AI-ից

PPO (Proximal Policy Optimization) — դա քաղաքականության օպտիմալացման ալգորիթմ է, որը լայնորեն օգտագործվում է RLHF-ում (Մարդու հետադարձ կապով ամրապնդման ուսուցում)՝ լեզվական մոդելների լրացուցիչ ուսուցման համար՝ հաշվի առնելով մարդկային հետադարձ կապը:

PPO-ի հիմնական գաղափարը՝ թարմացնել քաղաքականությունը այնպես, որ այն շատ չտարբերվի ներկայիսից, ինչը կանխում է ուսուցման անկայունությունը։ Դրա համար օգտագործվում է հատուկ կորուստային ֆունկցիա, որը սահմանափակում է թարմացման չափը։

PPO-ում կորուստը սովորաբար հաշվարկվում է հետևյալ կերպ՝

L^{CLIP}(	heta) = \mathbb{E}_t \left[ \ min \left( r_t(\theta) \hat{A}_t, \text{clip}(r_t(\theta), 1 - \epsilon, 1 + \epsilon) \hat{A}_t \right) \right]

որտեղ՝

  • $r_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}$ — նոր և հին քաղաքականությունների հավանականությունների հարաբերակցությունը գործողության $a_t$ համար $s_t$ վիճակում;
  • $\hat{A}_t$ — առավելության գնահատական;
  • $\epsilon$ — հիպերպարամետր, որը սահմանում է թույլատրելի փոփոխությունների տիրույթը:

Այսպիսով, կորուստը պատժում է այն թարմացումները, որոնք շատ մեծ փոփոխություններ են բերում քաղաքականությանը, պահելով ուսուցման կայունությունն ու արդյունավետությունը։ RLHF-ում PPO-ն օգտագործվում է մոդելի օպտիմալացման համար՝ հաշվի առնելով մարդկային հետադարձ կապից ստացված պարգևները։