Sobes.tech
Middle — Senior

Šta je SARSA i kako se razlikuje od Q-learninga?

sobes.tech АИ

Одговор од АИ

SARSA (Stanje-Akcija-Nagrada-Stanje-Akcija) i Q-učenje su algoritmi učenja pojačanja koji koriste Q-funkciju za procenu kvaliteta akcija u stanjima, ali se razlikuju u načinu ažuriranja Q-vrednosti.

Glavna razlika:

  • U SARSA, ažuriranje Q-vrednosti se zasniva na akciji koju je agent stvarno odabrao u sledećem stanju (tj. politika on-policy). Formula ažuriranja:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma Q(s', a') - Q(s,a)\big) ]

    gde je (a') akcija odabrana u skladu sa trenutnom politikom u stanju (s').

  • U Q-učenju, ažuriranje se vrši na osnovu maksimalne Q-vrednosti među svim mogućim akcijama u sledećem stanju (off-policy), nezavisno od akcije koju je agent odabrao. Formula:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma \max_{a'} Q(s', a') - Q(s,a)]

Rezime:

  • SARSA uzima u obzir politiku agenta tokom ažuriranja (ažurira Q-vrednosti u skladu sa načinom na koji agent zaista deluje).
  • Q-učenje teži ka optimalnoj politici, ažurirajući Q-vrednosti na osnovu maksimuma, čak i ako agent deluje drugačije.

Ovo može dovesti do toga da je SARSA konzervativniji i uzima u obzir rizik, dok je Q-učenje agresivnije u potrazi za optimalnom strategijom.