Sobes.tech
Middle — Senior

O que é SARSA e como difere do Q-learning?

sobes.tech IA

Resposta da IA

SARSA (Estado-Ação-Recompensa-Estado-Ação) e Q-learning são algoritmos de aprendizagem por reforço que usam a função Q para avaliar a qualidade das ações nos estados, mas diferem na forma como atualizam os valores Q.

Diferença principal:

  • No SARSA, a atualização do valor Q baseia-se na ação que o agente realmente escolheu no próximo estado (ou seja, política on-policy). A fórmula de atualização:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma Q(s', a') - Q(s,a)\big) ]

    onde (a') é a ação escolhida de acordo com a política atual no estado (s').

  • No Q-learning, a atualização é feita com base no valor Q máximo entre todas as ações possíveis no próximo estado (off-policy), independentemente da ação que o agente escolheu. A fórmula:

    [ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma \max_{a'} Q(s', a') - Q(s,a)\big) ]

Resumo:

  • SARSA leva em consideração a política do agente ao atualizar (atualiza os valores Q de acordo com como o agente realmente age).
  • Q-learning busca a política ótima, atualizando os valores Q com base no máximo, mesmo que o agente aja de forma diferente.

Isso faz com que SARSA possa ser mais conservador e considerar o risco, enquanto Q-learning é mais agressivo na busca pela estratégia ótima.