Sobes.tech
Middle — Senior

O que é a função de vantagem e por que ela reduz a variância?

sobes.tech IA

Resposta da IA

A função de vantagem (advantage function) no aprendizado por reforço é uma medida de quão melhor é uma ação em comparação com a ação média em um determinado estado. Formalmente, vantagem A(s, a) = Q(s, a) - V(s), onde Q(s, a) é a recompensa esperada ao executar a ação a no estado s, e V(s) é a recompensa média esperada no estado s.

O uso da função de vantagem ajuda a reduzir a variância das estimativas do gradiente em métodos de aprendizado por reforço, como o gradiente de política. Em vez de usar a estimativa completa Q(s, a), subtrai-se a linha de base V(s), o que diminui a dispersão dos valores sem afetar a esperança matemática do gradiente. Isso leva a um treinamento mais estável e eficiente.

Exemplo:

# Suponhamos que temos as funções Q e V
Q_sa = 10  # recompensa esperada para a ação a no estado s
V_s = 7    # recompensa média esperada no estado s
advantage = Q_sa - V_s  # vantagem = 3

O valor da vantagem mostra o quão melhor é a ação em relação à média, e é usado para atualizar a política com menor dispersão.