Sobes.tech
Middle — Senior

Ի՞նչ է SARSA-ն և ինչպե՞ս է այն տարբերվում Q-learning-ից։

sobes.tech AI

Պատասխան AI-ից

SARSA (Ավസ്ഥան-Գործողություն-Մրցանակ-Ավസ്ഥան-Գործողություն) և Q-ուսումնասիրությունը ալգորիթմներ են, որոնք օգտագործում են Q-ֆունկցիան՝ գնահատելու գործողությունների որակը վիճակներում, բայց տարբեր են Q-արժեքների թարմացման մեթոդներով:

Հիմնական տարբերություն:

  • SARSA-ում, Q-արժեքի թարմացումը հիմնված է այն գործողության վրա, որը գործակալը իրականում ընտրել է հաջորդ վիճակում (այսինքն, քաղաքականություն on-policy): Թարմացման ֆորմուլան:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma Q(s', a') - Q(s,a)\big) ]

    որտեղ (a') այն գործողությունն է, որը ընտրվել է ընթացիկ քաղաքականությամբ հաջորդ վիճակում (s'):

  • Q-ուսումնասիրության մեջ, թարմացումը կատարվում է բոլոր հնարավոր գործողությունների առավելագույն արժեքի հիման վրա հաջորդ վիճակում (off-policy), անկախ այն բանից, թե ինչ գործողություն է ընտրել գործակալը: Ֆորմուլա:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma \max_{a'} Q(s', a') - Q(s,a)]

Ամփոփում:

  • SARSA-ն հաշվի է առնում գործակալի քաղաքականությունը թարմացման ժամանակ (թարմացնում է Q-արժեքները ըստ այն բանի, թե ինչպես է գործակալը իրականում գործում):
  • Q-ուսումնասիրությունը ձգտում է օպտիմալ քաղաքականությանը, թարմացնելով Q-արժեքները առավելության հիման վրա, նույնիսկ եթե գործակալը գործում է այլ կերպ:

Այսպիսով, SARSA-ն կարող է լինել ավելի պահպանողական և հաշվի առնել ռիսկը, մինչդեռ Q-ուսումնասիրությունը ավելի ագրեսիվ է օպտիմալ ռազմավարությունը որոնելիս: