Šta je SARSA i kako se razlikuje od Q-learninga?
sobes.tech АИ
Одговор од АИ
SARSA (Stanje-Akcija-Nagrada-Stanje-Akcija) i Q-učenje su algoritmi učenja pojačanja koji koriste Q-funkciju za procenu kvaliteta akcija u stanjima, ali se razlikuju u načinu ažuriranja Q-vrednosti.
Glavna razlika:
-
U SARSA, ažuriranje Q-vrednosti se zasniva na akciji koju je agent stvarno odabrao u sledećem stanju (tj. politika on-policy). Formula ažuriranja:
[ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma Q(s', a') - Q(s,a)\big) ]
gde je (a') akcija odabrana u skladu sa trenutnom politikom u stanju (s').
-
U Q-učenju, ažuriranje se vrši na osnovu maksimalne Q-vrednosti među svim mogućim akcijama u sledećem stanju (off-policy), nezavisno od akcije koju je agent odabrao. Formula:
[ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma \max_{a'} Q(s', a') - Q(s,a)]
Rezime:
- SARSA uzima u obzir politiku agenta tokom ažuriranja (ažurira Q-vrednosti u skladu sa načinom na koji agent zaista deluje).
- Q-učenje teži ka optimalnoj politici, ažurirajući Q-vrednosti na osnovu maksimuma, čak i ako agent deluje drugačije.
Ovo može dovesti do toga da je SARSA konzervativniji i uzima u obzir rizik, dok je Q-učenje agresivnije u potrazi za optimalnom strategijom.