Sobes.tech
Middle — Senior

Qu'est-ce que SARSA et en quoi diffère-t-il du Q-learning?

sobes.tech IA

Réponse de l'IA

SARSA (État-Action-Récompense-État-Action) et Q-learning sont des algorithmes d'apprentissage par renforcement qui utilisent la fonction Q pour évaluer la qualité des actions dans les états, mais diffèrent dans leur méthode de mise à jour des valeurs Q.

Différence principale :

  • Dans SARSA, la mise à jour de Q se base sur l'action que l'agent a réellement choisie dans l'état suivant (politique en-policy). La formule de mise à jour :

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma Q(s', a') - Q(s,a)\big) ]

    où (a') est l'action choisie selon la politique actuelle dans l'état (s').

  • Dans Q-learning, la mise à jour se fait en utilisant la valeur Q maximale parmi toutes les actions possibles dans l'état suivant (off-policy), indépendamment de l'action choisie par l'agent. La formule :

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma \max_{a'} Q(s', a') - Q(s,a)\big) ]

Résumé :

  • SARSA prend en compte la politique de l'agent lors de la mise à jour (met à jour les valeurs Q selon la façon dont l'agent agit réellement).
  • Q-learning vise la politique optimale, en mettant à jour les valeurs Q en fonction du maximum, même si l'agent agit différemment.

Cela peut rendre SARSA plus conservateur et prudent face au risque, tandis que Q-learning est plus agressif dans la recherche de la stratégie optimale.