Sobes.tech
Middle — Senior

SARSA چیست و چگونه با Q-learning تفاوت دارد؟

sobes.tech AI

Ҷавоб аз AI

SARSA (Давлат-Ҳаракат-Мавозин-Давлат-Ҳаракат) ва Q-ўрганиш — бу мустаҳкамлаш ўрганиш алгоритмлари бўлиб, улар Q-функциясидан фаолиятнинг сифатини баҳолаш учун фойдаланадилар, аммо Q-қаимларни янгилаш усуллари бўйича фарқ қиладилар.

Асосий фарқ:

  • SARSAда, Q-қаим янгилаш ҳақиқатан агент томонидан кейинги ҳолатда танланган ҳаракатга асосланади (яъни, политика он-политси). Янгилаш формуласи:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma Q(s', a') - Q(s,a)]

    бу ерда (a') — ҳозирги сиёсатга мувофиқ танланган ҳаракат.

  • Q-ўрганишда, янгилаш кейинги ҳолатдаги барча мумкин бўлган ҳаракатлар орасида энг юқори Q-қаимга асосланади (off-policy), агент танлаган ҳаракатдан мустақил. Формула:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma \max_{a'} Q(s', a') - Q(s,a)]

Хулоса:

  • SARSA янгилашда агент сиёсатини ҳисобга олади (у Q-қаимларни агент ҳақиқатан қандай ҳаракат қилса, шунга мувофиқ янгилайди).
  • Q-ўрганиш энг яхши сиёсатга интилади, максимум асосида янгилайди, ҳатто агент бошқача ҳаракат қилса ҳам.

Бу SARSAни кўпроқ сақловчи ва хавфни ҳисобга олишга олиб келиши мумкин, Q-ўрганиш эса энг яхши стратегияни излашда янада агрессив бўлиши мумкин.