Sobes.tech
Middle — Senior

რა არის SARSA და როგორ განსხვავდება იგი Q-learning-დან?

sobes.tech AI

პასუხი AI-სგან

SARSA (Давлат-Иш-Жаза-Давлат-Иш) жана Q-үйрөнүү — бул күчөтүүчү үйрөнүү алгоритмдери, алар Q-функциясын колдонуп, абалдарда аракеттердин сапатын баалайт, бирок Q-баалууларынын жаңыртуу ыкмалары боюнча айырмаланышат.

Негизги айырма:

  • SARSAда, Q-баалуулук жаңыртуусу агент чын эле кийинки абалда тандаган аракетке негизделет (демек, саясат on-policy). Жаңыртуу формуласы:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma Q(s', a') - Q(s,a)]

    бул жерде (a') — учурдагы саясатка ылайык тандалган аракет.

  • Q-үйрөнүүдө, жаңыртуу кийинки абалда мүмкүн болгон бардык аракеттердин эң жогорку Q-баалуулугуна негизделет (off-policy), агент тандаган аракеттен көз каранды эмес. Формула:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma \max_{a'} Q(s', a') - Q(s,a)]

Жыйынтык:

  • SARSA жаңыртууда агенттин саясатын эске алат (Q-баалуулук аракеттердин чындыкта кандай жасалганына ылайык жаңыртылат).
  • Q-үйрөнүү эң жакшы саясатка умтулат, максимумга негизделген жаңыртууларды жасайт, агент башкача аракет кылса да.

Бул SARSAны көбүрөөк сактоочу жана коркунучту эске алуучу кылышы мүмкүн, ал эми Q-үйрөнүү эң жакшы стратегияны издөөгө көбүрөөк агрессивдүү болот.