Qu'est-ce que SARSA et en quoi diffère-t-il du Q-learning?
sobes.tech IA
Réponse de l'IA
SARSA (État-Action-Récompense-État-Action) et Q-learning sont des algorithmes d'apprentissage par renforcement qui utilisent la fonction Q pour évaluer la qualité des actions dans les états, mais diffèrent dans leur méthode de mise à jour des valeurs Q.
Différence principale :
-
Dans SARSA, la mise à jour de Q se base sur l'action que l'agent a réellement choisie dans l'état suivant (politique en-policy). La formule de mise à jour :
[ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma Q(s', a') - Q(s,a)\big) ]
où (a') est l'action choisie selon la politique actuelle dans l'état (s').
-
Dans Q-learning, la mise à jour se fait en utilisant la valeur Q maximale parmi toutes les actions possibles dans l'état suivant (off-policy), indépendamment de l'action choisie par l'agent. La formule :
[ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma \max_{a'} Q(s', a') - Q(s,a)\big) ]
Résumé :
- SARSA prend en compte la politique de l'agent lors de la mise à jour (met à jour les valeurs Q selon la façon dont l'agent agit réellement).
- Q-learning vise la politique optimale, en mettant à jour les valeurs Q en fonction du maximum, même si l'agent agit différemment.
Cela peut rendre SARSA plus conservateur et prudent face au risque, tandis que Q-learning est plus agressif dans la recherche de la stratégie optimale.