Sobes.tech
Middle — Senior

Was ist SARSA und wie unterscheidet es sich vom Q-Learning?

sobes.tech KI

Antwort von AI

SARSA (Zustand-Aktion-Belohnung-Zustand-Aktion) und Q-Learning sind Verstärkungslernalgorithmen, die die Q-Funktion verwenden, um die Qualität von Aktionen in Zuständen zu bewerten, unterscheiden sich jedoch in ihrer Methode zur Aktualisierung der Q-Werte.

Hauptunterschied:

  • Bei SARSA basiert die Aktualisierung des Q-Werts auf der Aktion, die der Agent im nächsten Zustand tatsächlich gewählt hat (d.h. on-policy). Die Aktualisierungsformel:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma Q(s', a') - Q(s,a)\big) ]

    wobei (a') die Aktion ist, die gemäß der aktuellen Politik im Zustand (s') gewählt wurde.

  • Bei Q-Learning erfolgt die Aktualisierung auf Basis des maximalen Q-Werts unter allen möglichen Aktionen im nächsten Zustand (off-policy), unabhängig von der Aktion, die der Agent gewählt hat. Die Formel:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma \max_{a'} Q(s', a') - Q(s,a)\big) ]

Zusammenfassung:

  • SARSA berücksichtigt die Politik des Agenten bei der Aktualisierung (es aktualisiert Q-Werte entsprechend dem tatsächlichen Verhalten des Agenten).
  • Q-Learning strebt die optimale Politik an, indem es die Q-Werte auf Basis des Maximums aktualisiert, auch wenn der Agent anders handelt.

Dies kann dazu führen, dass SARSA konservativer ist und Risiko berücksichtigt, während Q-Learning aggressiver bei der Suche nach der optimalen Strategie ist.