Sobes.tech
Middle — Senior

Čo je SARSA a ako sa líši od Q-learningu?

sobes.tech AI

Odpoveď od AI

SARSA (Stav-Akcia-Odmena-Stav-Akcia) a Q-učebné sú algoritmy posilňovacieho učenia, ktoré používajú Q-funkciu na hodnotenie kvality akcií v stavoch, ale líšia sa spôsobom aktualizácie hodnôt Q.

Hlavný rozdiel:

  • V SARSA je aktualizácia hodnoty Q založená na akcii, ktorú agent skutočne zvolil v nasledujúcom stave (t.j. politika on-policy). Vzorec aktualizácie:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma Q(s', a') - Q(s,a)\big) ]

    kde (a') je akcia zvolená podľa aktuálnej politiky v stave (s').

  • V Q-učebnom procese je aktualizácia založená na maximálnej hodnote Q medzi všetkými možnými akciami v nasledujúcom stave (off-policy), bez ohľadu na akciu, ktorú agent zvolil. Vzorec:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma \max_{a'} Q(s', a') - Q(s,a)]

Zhrnutie:

  • SARSA berie do úvahy politiku agenta počas aktualizácie (aktualizuje hodnoty Q podľa toho, ako agent skutočne koná).
  • Q-učebný proces usiluje o optimálnu politiku, aktualizujúc hodnoty Q na základe maxima, aj keď agent koná inak.

Toto môže viesť k tomu, že SARSA môže byť konzervatívnejší a zohľadňovať riziko, zatiaľ čo Q-učebný proces je agresívnejší pri hľadaní optimálnej stratégie.