Čo je SARSA a ako sa líši od Q-learningu?
sobes.tech AI
Odpoveď od AI
SARSA (Stav-Akcia-Odmena-Stav-Akcia) a Q-učebné sú algoritmy posilňovacieho učenia, ktoré používajú Q-funkciu na hodnotenie kvality akcií v stavoch, ale líšia sa spôsobom aktualizácie hodnôt Q.
Hlavný rozdiel:
-
V SARSA je aktualizácia hodnoty Q založená na akcii, ktorú agent skutočne zvolil v nasledujúcom stave (t.j. politika on-policy). Vzorec aktualizácie:
[ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma Q(s', a') - Q(s,a)\big) ]
kde (a') je akcia zvolená podľa aktuálnej politiky v stave (s').
-
V Q-učebnom procese je aktualizácia založená na maximálnej hodnote Q medzi všetkými možnými akciami v nasledujúcom stave (off-policy), bez ohľadu na akciu, ktorú agent zvolil. Vzorec:
[ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma \max_{a'} Q(s', a') - Q(s,a)]
Zhrnutie:
- SARSA berie do úvahy politiku agenta počas aktualizácie (aktualizuje hodnoty Q podľa toho, ako agent skutočne koná).
- Q-učebný proces usiluje o optimálnu politiku, aktualizujúc hodnoty Q na základe maxima, aj keď agent koná inak.
Toto môže viesť k tomu, že SARSA môže byť konzervatívnejší a zohľadňovať riziko, zatiaľ čo Q-učebný proces je agresívnejší pri hľadaní optimálnej stratégie.