Sobes.tech
Middle — Senior

Wat is SARSA en hoe verschilt het van Q-learning?

sobes.tech AI

Antwoord van AI

SARSA (State-Action-Reward-State-Action) en Q-learning zijn algoritmen voor versterkend leren die de Q-functie gebruiken om de kwaliteit van acties in staten te beoordelen, maar verschillen in de manier waarop ze Q-waarden bijwerken.

Belangrijkste verschil:

  • Bij SARSA wordt de Q-waarde bijgewerkt op basis van de actie die de agent daadwerkelijk heeft gekozen in de volgende staat (d.w.z. on-policy beleid). De update-formule:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma Q(s', a') - Q(s,a)\big) ]

    waar (a') de actie is die volgens het huidige beleid in staat (s') is gekozen.

  • Bij Q-learning wordt de update gedaan op basis van de maximale Q-waarde onder alle mogelijke acties in de volgende staat (off-policy), ongeacht welke actie de agent heeft gekozen. De formule:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma \max_{a'} Q(s', a') - Q(s,a)]

Samenvatting:

  • SARSA houdt rekening met het beleid van de agent tijdens het bijwerken (het werkt Q-waarden bij op basis van hoe de agent daadwerkelijk handelt).
  • Q-learning streeft naar het optimale beleid door de Q-waarden bij te werken op basis van het maximum, zelfs als de agent anders handelt.

Dit kan ertoe leiden dat SARSA conservatiever is en risico's meerekent, terwijl Q-learning agressiever is in het zoeken naar de optimale strategie.