Sobes.tech
Middle — Senior

Cos'è SARSA e come si differenzia dal Q-learning?

sobes.tech AI

Risposta dell'AI

SARSA (Stato-Azione-Ricompensa-Stato-Azione) e Q-learning sono algoritmi di apprendimento per rinforzo che utilizzano la funzione Q per valutare la qualità delle azioni negli stati, ma differiscono nel modo in cui aggiornano i valori Q.

Principale differenza:

  • In SARSA, l'aggiornamento del valore Q si basa sull'azione che l'agente ha effettivamente scelto nel prossimo stato (cioè, politica on-policy). La formula di aggiornamento:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma Q(s', a') - Q(s,a)\big) ]

    dove (a') è l'azione scelta secondo la politica attuale nello stato (s').

  • In Q-learning, l'aggiornamento si basa sul valore Q massimo tra tutte le azioni possibili nel prossimo stato (off-policy), indipendentemente dall'azione scelta dall'agente. La formula:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma \max_{a'} Q(s', a') - Q(s,a)\big) ]

Riassunto:

  • SARSA tiene conto della politica dell'agente durante l'aggiornamento (aggiorna i valori Q in base a come l'agente agisce realmente).
  • Q-learning mira alla politica ottimale, aggiornando i valori Q in base al massimo, anche se l'agente agisce diversamente.

Questo può rendere SARSA più conservativo e attento al rischio, mentre Q-learning è più aggressivo nella ricerca della strategia ottimale.