SARSA چیست و چگونه با Q-learning تفاوت دارد؟
sobes.tech AI
Ҷавоб аз AI
SARSA (Давлат-Ҳаракат-Мавозин-Давлат-Ҳаракат) ва Q-ўрганиш — бу мустаҳкамлаш ўрганиш алгоритмлари бўлиб, улар Q-функциясидан фаолиятнинг сифатини баҳолаш учун фойдаланадилар, аммо Q-қаимларни янгилаш усуллари бўйича фарқ қиладилар.
Асосий фарқ:
-
SARSAда, Q-қаим янгилаш ҳақиқатан агент томонидан кейинги ҳолатда танланган ҳаракатга асосланади (яъни, политика он-политси). Янгилаш формуласи:
[ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma Q(s', a') - Q(s,a)]
бу ерда (a') — ҳозирги сиёсатга мувофиқ танланган ҳаракат.
-
Q-ўрганишда, янгилаш кейинги ҳолатдаги барча мумкин бўлган ҳаракатлар орасида энг юқори Q-қаимга асосланади (off-policy), агент танлаган ҳаракатдан мустақил. Формула:
[ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma \max_{a'} Q(s', a') - Q(s,a)]
Хулоса:
- SARSA янгилашда агент сиёсатини ҳисобга олади (у Q-қаимларни агент ҳақиқатан қандай ҳаракат қилса, шунга мувофиқ янгилайди).
- Q-ўрганиш энг яхши сиёсатга интилади, максимум асосида янгилайди, ҳатто агент бошқача ҳаракат қилса ҳам.
Бу SARSAни кўпроқ сақловчи ва хавфни ҳисобга олишга олиб келиши мумкин, Q-ўрганиш эса энг яхши стратегияни излашда янада агрессив бўлиши мумкин.