Sobes.tech
Middle — Senior

Mis on SARSA ja kuidas see erineb Q-learningust?

sobes.tech AI

Vastus AI-lt

SARSA (Oleku-Tegevus-Hinnang-Oleku-Tegevus) ja Q-õppimine on tugevdamise õppimise algoritmid, mis kasutavad Q-funktsiooni tegevuste kvaliteedi hindamiseks olekutes, kuid erinevad Q-väärtuste uuendamise viisides.

Peamine erinevus:

  • SARSA-s põhineb Q-väärtuse uuendamine tegevusel, mille agent tegelikult valis järgmisel olekul (st. poliitika on-policy). Uuendamise valem:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma Q(s', a') - Q(s,a)]

    kus (a') on tegevus, mis valiti vastavalt kehtivale poliitikale järgmisel olekul (s').

  • Q-õppimises põhineb uuendus maksimaalsel Q-väärtusel kõigi võimalike tegevuste vahel järgmisel olekul (off-policy), sõltumata sellest, millise tegevuse agent valis. Valem:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma \max_{a'} Q(s', a') - Q(s,a)]

Kokkuvõte:

  • SARSA arvestab agendi poliitikat uuendamise ajal (uuendab Q-väärtusi vastavalt sellele, kuidas agent tegelikult käitub).
  • Q-õppimine püüab saavutada optimaalset poliitikat, uuendades Q-väärtusi maksimumi alusel, isegi kui agent käitub teisiti.

See võib teha SARSA-st konservatiivsem ja riskide arvestavam, samas kui Q-õppimine on agressiivsem optimaalse strateegia otsimisel.