Sobes.tech
Middle — Senior

¿Qué es SARSA y en qué se diferencia de Q-learning?

sobes.tech AI

Respuesta de la IA

SARSA (Estado-Acción-Recompensa-Estado-Acción) y Q-learning son algoritmos de aprendizaje por refuerzo que utilizan la función Q para evaluar la calidad de las acciones en los estados, pero difieren en la forma en que actualizan los valores Q.

Diferencia principal:

  • En SARSA, la actualización del valor Q se basa en la acción que el agente realmente eligió en el siguiente estado (es decir, política en-policy). La fórmula de actualización:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma Q(s', a') - Q(s,a)\big) ]

    donde (a') es la acción elegida según la política actual en el estado (s').

  • En Q-learning, la actualización se realiza en función del valor Q máximo entre todas las acciones posibles en el siguiente estado (off-policy), independientemente de la acción que eligió el agente. La fórmula:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma \max_{a'} Q(s', a') - Q(s,a)\big) ]

Resumen:

  • SARSA tiene en cuenta la política del agente al actualizar (actualiza los valores Q según cómo actúa realmente el agente).
  • Q-learning busca la política óptima, actualizando los valores Q en función del máximo, incluso si el agente actúa de otra manera.

Esto lleva a que SARSA pueda ser más conservador y considerar el riesgo, mientras que Q-learning es más agresivo en la búsqueda de la estrategia óptima.