Middle — Senior
RLHF контекстинде PPO эмне жана зыянды кантип эсептейт?
sobes.tech AI
AIден жооп
PPO (Proximal Policy Optimization) — бул саясатты оптималдаштыруу алгоритми, ал кеңири колдонулат RLHFде (Ички пикир менен бекемдөө үйрөнүү) тилдик моделдерди адамдык пикирлерди эске алуу менен кайра үйрөтүү үчүн.
PPOнун негизги идеясы — саясатты азыркыдан өтө алыс болбой жаңыртуу, бул үйрөнүүнүн туруктуулугун алдын алат. Бул үчүн атайын жоготуу функциясы колдонулат, ал жаңыртуунун көлөмүн чектейт.
PPOдо жоготуу адатта төмөнкүдөй эсептелет:
L^{CLIP}( heta) = \mathbb{E}_t \left[ \min \left( r_t(\theta) \hat{A}_t, \text{clip}(r_t(\theta), 1 - \epsilon, 1 + \epsilon) \hat{A}_t \right) \right]
мында:
- $r_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}$ — жаңы жана эски саясаттын ыктымалдуулук катышы;
- $\hat{A}_t$ — артыкчылык баалоо;
- $\epsilon$ — гиперпараметр, ал уруксат берилген өзгөрүүлөрдүн диапазонун аныктайт.
Мындайча айтканда, жоготуу саясатты өтө көп өзгөртүп жаткан жаңыртууларды жазалайт жана ошентип, үйрөнүүнүн туруктуулугун жана натыйжалуулугун сактайт. RLHFде PPO моделди оптималдаштыруу үчүн колдонулат, адамдык пикирлерден алынган сыйлыктарды эске алуу менен.