Sobes.tech
Middle — Senior

Kas yra SARSA ir kaip jis skiriasi nuo Q-learning?

sobes.tech AI

Atsakymas iš AI

SARSA (Būsena-Veiksmas-Apmokėjimas-Būsena-Veiksmas) ir Q-mokymasis yra stiprinimo mokymosi algoritmai, kurie naudoja Q funkciją vertinti veiksmų kokybę būsenose, tačiau skiriasi atnaujinimo būdais.

Pagrindinis skirtumas:

  • SARSA atnaujinimas grindžiamas veiksmu, kurį agentas iš tikrųjų pasirinko kitame būste (t. y. politikos on-policy). Atnaujinimo formulė:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma Q(s', a') - Q(s,a)]

    kur (a') yra veiksmas, pasirinktas pagal esamą politiką būste (s').

  • Q-mokymesi atnaujinimas grindžiamas didžiausia Q verte tarp visų galimų veiksmų kitame būste (off-policy), nepriklausomai nuo to, kurį veiksmą pasirinko agentas. Formulė:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma \max_{a'} Q(s', a') - Q(s,a)]

Santrauka:

  • SARSA atsižvelgia į agento politiką atnaujinimo metu (atnaujina Q vertes pagal tai, kaip agentas iš tikrųjų veikia).
  • Q-mokymasis siekia optimalaus politikos, atnaujindamas Q vertes pagal maksimumą, net jei agentas veikia kitaip.

Tai gali lemti, kad SARSA gali būti konservatyvesnis ir atsižvelgti į riziką, o Q-mokymasis gali būti agresyvesnis ieškant optimalaus strategijos.