Sobes.tech
Middle — Senior

SARSA nedir ve Q-learning'den nasıl ayrılır?

sobes.tech yapay zeka

AI'dan gelen yanıt

SARSA (Durum-İşlem-Ödül-Durum-İşlem) ve Q-öğrenme, durumlarda eylemlerin kalitesini değerlendirmek için Q fonksiyonunu kullanan pekiştirmeli öğrenme algoritmalarıdır, ancak Q-değerlerini güncelleme yöntemleri açısından farklılık gösterirler.

Ana fark:

  • SARSA'da, Q-değeri güncellemesi, ajan tarafından gerçekten seçilen eyleme dayanır (yani, politika on-policy). Güncelleme formülü:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma Q(s', a') - Q(s,a)\big) ]

    burada (a'), (s') durumunda mevcut politika ile seçilen eylemdir.

  • Q-öğrenmede, güncelleme, bir sonraki durumda mümkün olan tüm eylemler arasında en yüksek Q-değeri temel alınarak yapılır (off-policy), ajan tarafından seçilen eylemden bağımsızdır. Formül:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma \max_{a'} Q(s', a') - Q(s,a)\big) ]

Özet:

  • SARSA, güncelleme sırasında ajan politikasını dikkate alır (Q-değerlerini, ajan gerçekten nasıl hareket ediyorsa ona göre günceller).
  • Q-öğrenme, maksimuma göre güncelleyerek en iyi politikayı hedefler, hatta ajan farklı hareket etse bile.

Bu, SARSA'nın daha muhafazakar ve riskleri dikkate alan olmasını sağlayabilirken, Q-öğrenme en iyi stratejiyi aramada daha agresif olabilir.