Sobes.tech
Middle — Senior

რა არის PPO RLHF კონტექსტში და როგორ ითვლება დაკარგვა?

sobes.tech AI

პასუხი AI-სგან

PPO (Proximal Policy Optimization) — ეს არის პოლიტიკის ოპტიმიზაციის ალგორითმი გამაძლიერებელი სწავლების სფეროში, რომელიც ფართოდ გამოიყენება RLHF-ში (ადამიანური უკუკავშირის გამაძლიერებელი სწავლება) — ენის მოდელების დამატებითი სწავლებისთვის, ადამიანის უკუკავშირის გათვალისწინებით.

PPO-ს მთავარი იდეაა, რომ განაახლოს პოლიტიკა ისე, რომ ის ძალიან არ განვრცეს მიმდინარე პოლიტიკიდან, რაც თავიდან აცილებს სწავლების არასტაბილურობას. ამისთვის გამოიყენება სპეციალური ზარალის ფუნქცია, რომელიც შეზღუდავს განახლების ზომას.

PPO-ში ზარალი ჩვეულებრივ ასე ითვლება:

L^{CLIP}(	heta) = \mathbb{E}_t \left[ \ min \left( r_t(\theta) \hat{A}_t, \text{clip}(r_t(\theta), 1 - \epsilon, 1 + \epsilon) \hat{A}_t \right) \right]

სადაც:

  • $r_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}$ — ახალი და ძველი პოლიტიკის ალბათობის შეფარდებაა მოქმედებისთვის $a_t$ მდგომარეობაში $s_t$;
  • $\hat{A}_t$ — უპირატესობის შეფასება;
  • $\epsilon$ — ჰიპერპარამეტრი, რომელიც განსაზღვრავს ცვლილებების დაშვებულ დიაპაზონს.

ამ გზით, ზარალი სასჯელს აყენებს იმ განახლებებს, რომლებიც ძალიან დიდ ცვლილებებს ახდენენ პოლიტიკაში, და ამით ინარჩუნებს სწავლების სტაბილურობას და ეფექტიანობას. RLHF-ში PPO გამოიყენება მოდელის ოპტიმიზაციისთვის, ადამიანის უკუკავშირისგან მიღებული ჯილდოების გათვალისწინებით.