Ce este SARSA și cum diferă de Q-learning?
sobes.tech AI
Răspuns de la AI
SARSA (Stare-Acțiune-Recompensă-Stare-Acțiune) și Q-learning sunt algoritmi de învățare prin întărire care utilizează funcția Q pentru a evalua calitatea acțiunilor în stări, dar diferă în modul în care actualizează valorile Q.
Diferența principală:
-
În SARSA, actualizarea valorii Q se bazează pe acțiunea pe care agentul a ales-o efectiv în starea următoare (adică, politică on-policy). Formula de actualizare:
[ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma Q(s', a') - Q(s,a)\big) ]
unde (a') este acțiunea aleasă conform politicii curente în starea (s').
-
În Q-learning, actualizarea se face pe baza valorii Q maxime dintre toate acțiunile posibile în starea următoare (off-policy), indiferent de acțiunea aleasă de agent. Formula:
[ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma \max_{a'} Q(s', a') - Q(s,a)]
Rezumat:
- SARSA ține cont de politica agentului în timpul actualizării (actualizează valorile Q în funcție de modul în care agentul acționează efectiv).
- Q-learning urmărește politica optimă, actualizând valorile Q pe baza maximului, chiar dacă agentul acționează diferit.
Acest lucru poate face ca SARSA să fie mai conservator și să ia în considerare riscul, în timp ce Q-learning este mai agresiv în căutarea strategiei optime.