Sobes.tech
Middle — Senior

Mi az a SARSA és miben különbözik a Q-learning-től?

sobes.tech MI

Válasz az MI-től

SARSA (Állapot-Action-Jutalom-Állapot-Action) és Q-learning olyan megerősítő tanulási algoritmusok, amelyek a Q-függvényt használják az állapotokban lévő akciók minőségének értékelésére, de különböznek a Q-értékek frissítésének módjában.

Fő különbség:

  • SARSA esetén a Q-érték frissítése az alapján történik, hogy az ügynök ténylegesen melyik akciót választotta a következő állapotban (azaz, on-policy politika). A frissítési képlet:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma Q(s', a') - Q(s,a)\big) ]

    ahol (a') a jelenlegi politikának megfelelően választott akció a (s') állapotban.

  • Q-learning esetén a frissítés a következő állapotban lévő összes lehetséges akció közül a maximális Q-értéken alapul (off-policy), függetlenül attól, hogy az ügynök melyik akciót választotta. A képlet:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma \max_{a'} Q(s', a') - Q(s,a)]

Összegzés:

  • SARSA figyelembe veszi az ügynök politikáját a frissítés során (azaz, a Q-értékeket az alapján frissíti, ahogyan az ügynök ténylegesen cselekszik).
  • Q-learning az optimális politikára törekszik, a Q-értékeket a maximum alapján frissítve, még akkor is, ha az ügynök másképp cselekszik.

Ez azt eredményezheti, hogy a SARSA konzervatívabb lehet és figyelembe veszi a kockázatokat, míg a Q-learning agresszívebben keresi az optimális stratégiát.