Mi az a SARSA és miben különbözik a Q-learning-től?
sobes.tech MI
Válasz az MI-től
SARSA (Állapot-Action-Jutalom-Állapot-Action) és Q-learning olyan megerősítő tanulási algoritmusok, amelyek a Q-függvényt használják az állapotokban lévő akciók minőségének értékelésére, de különböznek a Q-értékek frissítésének módjában.
Fő különbség:
-
SARSA esetén a Q-érték frissítése az alapján történik, hogy az ügynök ténylegesen melyik akciót választotta a következő állapotban (azaz, on-policy politika). A frissítési képlet:
[ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma Q(s', a') - Q(s,a)\big) ]
ahol (a') a jelenlegi politikának megfelelően választott akció a (s') állapotban.
-
Q-learning esetén a frissítés a következő állapotban lévő összes lehetséges akció közül a maximális Q-értéken alapul (off-policy), függetlenül attól, hogy az ügynök melyik akciót választotta. A képlet:
[ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma \max_{a'} Q(s', a') - Q(s,a)]
Összegzés:
- SARSA figyelembe veszi az ügynök politikáját a frissítés során (azaz, a Q-értékeket az alapján frissíti, ahogyan az ügynök ténylegesen cselekszik).
- Q-learning az optimális politikára törekszik, a Q-értékeket a maximum alapján frissítve, még akkor is, ha az ügynök másképp cselekszik.
Ez azt eredményezheti, hogy a SARSA konzervatívabb lehet és figyelembe veszi a kockázatokat, míg a Q-learning agresszívebben keresi az optimális stratégiát.