Kas ir SARSA un kā tas atšķiras no Q-learning?
sobes.tech AI
Atbilde no AI
SARSA (Stāvoklis-Darbība-Soda-Stāvoklis-Darbība) un Q-mācīšanās ir pastiprināta mācīšanās algoritmi, kas izmanto Q funkciju, lai novērtētu darbību kvalitāti stāvokļos, bet atšķiras pēc Q vērtību atjaunināšanas veida.
Galvenā atšķirība:
-
SARSA atjauninājums balstās uz to darbību, ko aģents patiešām izvēlējās nākamajā stāvoklī (t.i., politikas on-policy). Atjaunināšanas formula:
[ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma Q(s', a') - Q(s,a)]
kur (a') ir darbība, kas izvēlēta saskaņā ar pašreizējo politiku stāvoklī (s').
-
Q-mācīšanās atjauninājums balstās uz maksimālo Q vērtību starp visām iespējām darbībām nākamajā stāvoklī (off-policy), neatkarīgi no tā, kādu darbību ir izvēlējies aģents. Formula:
[ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma \max_{a'} Q(s', a') - Q(s,a)]
Kopsavilkums:
- SARSA ņem vērā aģenta politiku atjaunināšanas laikā (tas atjauno Q vērtības atbilstoši tam, kā aģents patiešām rīkojas).
- Q-mācīšanās tiecas uz optimālo politiku, atjauninot Q vērtības pēc maksimuma, pat ja aģents rīkojas citādi.
Tas var novest pie tā, ka SARSA var būt konservatīvāka un ņemt vērā risku, kamēr Q-mācīšanās ir agresīvāka meklējot optimālo stratēģiju.