Co je SARSA a čím se liší od Q-learningu?
sobes.tech AI
Odpověď od AI
SARSA (Stav-Action-Odměna-Stav-Action) a Q-learning jsou algoritmy posilovaného učení, které používají funkci Q k hodnocení kvality akcí ve stavech, ale liší se způsobem aktualizace hodnot Q.
Hlavní rozdíl:
-
V SARSA je aktualizace hodnoty Q založena na akci, kterou agent skutečně zvolil v následujícím stavu (tedy politika on-policy). Vzorec aktualizace:
[ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma Q(s', a') - Q(s,a)\big) ]
kde (a') je akce zvolena podle aktuální politiky ve stavu (s').
-
V Q-learning je aktualizace založena na maximální hodnotě Q mezi všemi možnými akcemi ve stavu (s') (off-policy), bez ohledu na akci, kterou agent zvolil. Vzorec:
[ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma \max_{a'} Q(s', a') - Q(s,a)]
Shrnutí:
- SARSA bere v úvahu politiku agenta při aktualizaci (aktualizuje hodnoty Q podle toho, jak agent skutečně jedná).
- Q-learning usiluje o optimální politiku, aktualizuje hodnoty Q na základě maxima, i když agent jedná jinak.
To může vést k tomu, že SARSA může být konzervativnější a zohledňovat riziko, zatímco Q-learning je agresivnější při hledání optimální strategie.