RLHF kontekstində PPO nədir və itki necə hesablanır?
sobes.tech Süni İntellekt
AI-dan cavab
PPO (Proximal Policy Optimization) — gücləndirmə öyrənməsində siyasət optimallaşdırma alqoritmidir və RLHF (İnsan Əlaqəsi ilə Gücləndirmə Öyrənməsi) çərçivəsində dil modellərinin insan geribildirimi nəzərə alınmaqla əlavə öyrədilməsində geniş istifadə olunur.
PPO-nun əsas ideyası, siyasəti mövcud vəziyyətdən çox uzaqlaşmadan yeniləməkdir ki, bu da öyrənmənin stabilliyini təmin edir. Bunun üçün xüsusi bir itki funksiyası istifadə olunur və bu, yeniləmənin miqyasını məhdudlaşdırır.
PPO-da itki adətən aşağıdakı kimi hesablanır:
L^{CLIP}( heta) = \mathbb{E}_t \left[ \min \left( r_t(\theta) \hat{A}_t, \text{clip}(r_t(\theta), 1 - \epsilon, 1 + \epsilon) \hat{A}_t \right) \right]
burada:
- $r_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}$ — yeni və köhnə siyasətin ehtimal nisbəti;
- $\hat{A}_t$ — üstünlük qiymətləndirməsi;
- $\epsilon$ — hiperparametr, icazə verilən dəyişiklik diapazonunu müəyyən edir.
Bu şəkildə, itki çox böyük dəyişikliklər edən yeniləmələri cəzalandırır və beləliklə, öyrənmənin stabilliyini və səmərəliliyini qoruyur. RLHF-də PPO, insan geribildirimi əsasında alınan mükafatları nəzərə alaraq modeli optimallaşdırmaq üçün istifadə olunur.