¿Qué es SARSA y en qué se diferencia de Q-learning?
sobes.tech AI
Respuesta de la IA
SARSA (Estado-Acción-Recompensa-Estado-Acción) y Q-learning son algoritmos de aprendizaje por refuerzo que utilizan la función Q para evaluar la calidad de las acciones en los estados, pero difieren en la forma en que actualizan los valores Q.
Diferencia principal:
-
En SARSA, la actualización del valor Q se basa en la acción que el agente realmente eligió en el siguiente estado (es decir, política en-policy). La fórmula de actualización:
[ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma Q(s', a') - Q(s,a)\big) ]
donde (a') es la acción elegida según la política actual en el estado (s').
-
En Q-learning, la actualización se realiza en función del valor Q máximo entre todas las acciones posibles en el siguiente estado (off-policy), independientemente de la acción que eligió el agente. La fórmula:
[ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma \max_{a'} Q(s', a') - Q(s,a)\big) ]
Resumen:
- SARSA tiene en cuenta la política del agente al actualizar (actualiza los valores Q según cómo actúa realmente el agente).
- Q-learning busca la política óptima, actualizando los valores Q en función del máximo, incluso si el agente actúa de otra manera.
Esto lleva a que SARSA pueda ser más conservador y considerar el riesgo, mientras que Q-learning es más agresivo en la búsqueda de la estrategia óptima.