Sobes.tech
Middle — Senior

Co je SARSA a čím se liší od Q-learningu?

sobes.tech AI

Odpověď od AI

SARSA (Stav-Action-Odměna-Stav-Action) a Q-learning jsou algoritmy posilovaného učení, které používají funkci Q k hodnocení kvality akcí ve stavech, ale liší se způsobem aktualizace hodnot Q.

Hlavní rozdíl:

  • V SARSA je aktualizace hodnoty Q založena na akci, kterou agent skutečně zvolil v následujícím stavu (tedy politika on-policy). Vzorec aktualizace:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma Q(s', a') - Q(s,a)\big) ]

    kde (a') je akce zvolena podle aktuální politiky ve stavu (s').

  • V Q-learning je aktualizace založena na maximální hodnotě Q mezi všemi možnými akcemi ve stavu (s') (off-policy), bez ohledu na akci, kterou agent zvolil. Vzorec:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma \max_{a'} Q(s', a') - Q(s,a)]

Shrnutí:

  • SARSA bere v úvahu politiku agenta při aktualizaci (aktualizuje hodnoty Q podle toho, jak agent skutečně jedná).
  • Q-learning usiluje o optimální politiku, aktualizuje hodnoty Q na základě maxima, i když agent jedná jinak.

To může vést k tomu, že SARSA může být konzervativnější a zohledňovat riziko, zatímco Q-learning je agresivnější při hledání optimální strategie.