Mis on SARSA ja kuidas see erineb Q-learningust?
sobes.tech AI
Vastus AI-lt
SARSA (Oleku-Tegevus-Hinnang-Oleku-Tegevus) ja Q-õppimine on tugevdamise õppimise algoritmid, mis kasutavad Q-funktsiooni tegevuste kvaliteedi hindamiseks olekutes, kuid erinevad Q-väärtuste uuendamise viisides.
Peamine erinevus:
-
SARSA-s põhineb Q-väärtuse uuendamine tegevusel, mille agent tegelikult valis järgmisel olekul (st. poliitika on-policy). Uuendamise valem:
[ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma Q(s', a') - Q(s,a)]
kus (a') on tegevus, mis valiti vastavalt kehtivale poliitikale järgmisel olekul (s').
-
Q-õppimises põhineb uuendus maksimaalsel Q-väärtusel kõigi võimalike tegevuste vahel järgmisel olekul (off-policy), sõltumata sellest, millise tegevuse agent valis. Valem:
[ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma \max_{a'} Q(s', a') - Q(s,a)]
Kokkuvõte:
- SARSA arvestab agendi poliitikat uuendamise ajal (uuendab Q-väärtusi vastavalt sellele, kuidas agent tegelikult käitub).
- Q-õppimine püüab saavutada optimaalset poliitikat, uuendades Q-väärtusi maksimumi alusel, isegi kui agent käitub teisiti.
See võib teha SARSA-st konservatiivsem ja riskide arvestavam, samas kui Q-õppimine on agressiivsem optimaalse strateegia otsimisel.