რა არის SARSA და როგორ განსხვავდება იგი Q-learning-დან?
sobes.tech AI
პასუხი AI-სგან
SARSA (Давлат-Иш-Жаза-Давлат-Иш) жана Q-үйрөнүү — бул күчөтүүчү үйрөнүү алгоритмдери, алар Q-функциясын колдонуп, абалдарда аракеттердин сапатын баалайт, бирок Q-баалууларынын жаңыртуу ыкмалары боюнча айырмаланышат.
Негизги айырма:
-
SARSAда, Q-баалуулук жаңыртуусу агент чын эле кийинки абалда тандаган аракетке негизделет (демек, саясат on-policy). Жаңыртуу формуласы:
[ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma Q(s', a') - Q(s,a)]
бул жерде (a') — учурдагы саясатка ылайык тандалган аракет.
-
Q-үйрөнүүдө, жаңыртуу кийинки абалда мүмкүн болгон бардык аракеттердин эң жогорку Q-баалуулугуна негизделет (off-policy), агент тандаган аракеттен көз каранды эмес. Формула:
[ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma \max_{a'} Q(s', a') - Q(s,a)]
Жыйынтык:
- SARSA жаңыртууда агенттин саясатын эске алат (Q-баалуулук аракеттердин чындыкта кандай жасалганына ылайык жаңыртылат).
- Q-үйрөнүү эң жакшы саясатка умтулат, максимумга негизделген жаңыртууларды жасайт, агент башкача аракет кылса да.
Бул SARSAны көбүрөөк сактоочу жана коркунучту эске алуучу кылышы мүмкүн, ал эми Q-үйрөнүү эң жакшы стратегияны издөөгө көбүрөөк агрессивдүү болот.