Sobes.tech
Middle — Senior

Kas ir SARSA un kā tas atšķiras no Q-learning?

sobes.tech AI

Atbilde no AI

SARSA (Stāvoklis-Darbība-Soda-Stāvoklis-Darbība) un Q-mācīšanās ir pastiprināta mācīšanās algoritmi, kas izmanto Q funkciju, lai novērtētu darbību kvalitāti stāvokļos, bet atšķiras pēc Q vērtību atjaunināšanas veida.

Galvenā atšķirība:

  • SARSA atjauninājums balstās uz to darbību, ko aģents patiešām izvēlējās nākamajā stāvoklī (t.i., politikas on-policy). Atjaunināšanas formula:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma Q(s', a') - Q(s,a)]

    kur (a') ir darbība, kas izvēlēta saskaņā ar pašreizējo politiku stāvoklī (s').

  • Q-mācīšanās atjauninājums balstās uz maksimālo Q vērtību starp visām iespējām darbībām nākamajā stāvoklī (off-policy), neatkarīgi no tā, kādu darbību ir izvēlējies aģents. Formula:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma \max_{a'} Q(s', a') - Q(s,a)]

Kopsavilkums:

  • SARSA ņem vērā aģenta politiku atjaunināšanas laikā (tas atjauno Q vērtības atbilstoši tam, kā aģents patiešām rīkojas).
  • Q-mācīšanās tiecas uz optimālo politiku, atjauninot Q vērtības pēc maksimuma, pat ja aģents rīkojas citādi.

Tas var novest pie tā, ka SARSA var būt konservatīvāka un ņemt vērā risku, kamēr Q-mācīšanās ir agresīvāka meklējot optimālo stratēģiju.