O que é o TD3 e quais as três melhorias que ele traz para o DDPG?
sobes.tech IA
Resposta da IA
TD3 (Twin Delayed Deep Deterministic policy gradient) é uma melhoria do algoritmo DDPG (Deep Deterministic Policy Gradient) para aprendizagem por reforço em tarefas com espaço de ações contínuo. O TD3 introduz três melhorias principais:
-
Críticos duplos (Twin Critics): São usadas duas redes neurais critic para avaliar a função Q. Ao atualizar, é considerado o valor mínimo dos dois, o que reduz a superestimação dos valores Q.
-
Atualizações de política atrasadas (Delayed Policy Updates): A política é atualizada com menos frequência do que os críticos (por exemplo, 2-3 vezes menos), o que estabiliza o treino.
-
Adição de ruído às ações durante o treino dos críticos (Target Policy Smoothing): Um pequeno ruído é adicionado às ações geradas pela política alvo, prevenindo o sobreajuste excessivo a valores pontuais e melhorando a generalização.
Essas melhorias tornam o TD3 mais estável e eficiente em comparação com o DDPG clássico.