O que é SARSA e como difere do Q-learning?
sobes.tech IA
Resposta da IA
SARSA (Estado-Ação-Recompensa-Estado-Ação) e Q-learning são algoritmos de aprendizagem por reforço que usam a função Q para avaliar a qualidade das ações nos estados, mas diferem na forma como atualizam os valores Q.
Diferença principal:
-
No SARSA, a atualização do valor Q baseia-se na ação que o agente realmente escolheu no próximo estado (ou seja, política on-policy). A fórmula de atualização:
[ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma Q(s', a') - Q(s,a)\big) ]
onde (a') é a ação escolhida de acordo com a política atual no estado (s').
-
No Q-learning, a atualização é feita com base no valor Q máximo entre todas as ações possíveis no próximo estado (off-policy), independentemente da ação que o agente escolheu. A fórmula:
[ Q(s,a) \leftarrow Q(s,a) + \alpha \big(r + \gamma \max_{a'} Q(s', a') - Q(s,a)\big) ]
Resumo:
- SARSA leva em consideração a política do agente ao atualizar (atualiza os valores Q de acordo com como o agente realmente age).
- Q-learning busca a política ótima, atualizando os valores Q com base no máximo, mesmo que o agente aja de forma diferente.
Isso faz com que SARSA possa ser mais conservador e considerar o risco, enquanto Q-learning é mais agressivo na busca pela estratégia ótima.