Sobes.tech
Middle — Senior

SARSA nədir və o, Q-learning-dən necə fərqlənir?

sobes.tech Süni İntellekt

AI-dan cavab

SARSA (Dövlət-Hərəkət-Mükafat-Dövlət-Hərəkət) və Q-öyrənmə, vəziyyətlərdə hərəkətlərin keyfiyyətini qiymətləndirmək üçün Q funksiyasını istifadə edən gücləndirmə öyrənmə alqoritmləridir, lakin Q-dəyərlərini yeniləmə üsulları ilə fərqlənirlər.

Əsas fərq:

  • SARSA-da, Q-dəyərinin yenilənməsi agentin növbəti vəziyyətdə faktiki seçdiyi hərəkətə əsaslanır (yəni, on-policy siyasət). Yeniləmə formulu:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma Q(s', a') - Q(s,a)\big) ]

    burada (a') cari siyasətə uyğun olaraq seçilmiş hərəkətdir.

  • Q-öyrənmədə, yeniləmə, növbəti vəziyyətdə mümkün olan bütün hərəkətlər arasında ən yüksək Q-dəyərinə əsaslanır (off-policy), agentin seçdiyi hərəkətdən asılı olmayaraq. Formul:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma \max_{a'} Q(s', a') - Q(s,a)]

Xülasə:

  • SARSA, yeniləmə zamanı agentin siyasətini nəzərə alır (Q-dəyərlərini agentin faktiki hərəkətinə uyğun yeniləyir).
  • Q-öyrənmə, maksimuma əsaslanaraq ən yaxşı strategiyanı hədəfləyir, hətta agent fərqli hərəkət etsə belə.

Bu, SARSA-nı daha ehtiyatlı və riskləri nəzərə alan edə bilər, Q-öyrənmə isə ən yaxşı strategiyanı tapmaqda daha aqressiv ola bilər.