Sobes.tech
Middle — Senior

Ce este SARSA și cum diferă de Q-learning?

sobes.tech AI

Răspuns de la AI

SARSA (Stare-Acțiune-Recompensă-Stare-Acțiune) și Q-learning sunt algoritmi de învățare prin întărire care utilizează funcția Q pentru a evalua calitatea acțiunilor în stări, dar diferă în modul în care actualizează valorile Q.

Diferența principală:

  • În SARSA, actualizarea valorii Q se bazează pe acțiunea pe care agentul a ales-o efectiv în starea următoare (adică, politică on-policy). Formula de actualizare:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma Q(s', a') - Q(s,a)\big) ]

    unde (a') este acțiunea aleasă conform politicii curente în starea (s').

  • În Q-learning, actualizarea se face pe baza valorii Q maxime dintre toate acțiunile posibile în starea următoare (off-policy), indiferent de acțiunea aleasă de agent. Formula:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma \max_{a'} Q(s', a') - Q(s,a)]

Rezumat:

  • SARSA ține cont de politica agentului în timpul actualizării (actualizează valorile Q în funcție de modul în care agentul acționează efectiv).
  • Q-learning urmărește politica optimă, actualizând valorile Q pe baza maximului, chiar dacă agentul acționează diferit.

Acest lucru poate face ca SARSA să fie mai conservator și să ia în considerare riscul, în timp ce Q-learning este mai agresiv în căutarea strategiei optime.