Sobes.tech
Middle — Senior

Ce este TD3 și ce trei îmbunătățiri aduce în DDPG?

sobes.tech AI

Răspuns de la AI

TD3 (Twin Delayed Deep Deterministic policy gradient) este o îmbunătățire a algoritmului DDPG (Deep Deterministic Policy Gradient) pentru învățarea prin întărire în sarcini cu spațiu de acțiune continuu. TD3 introduce trei îmbunătățiri cheie:

  1. Critici dubli (Twin Critics): Se utilizează două rețele neuronale critic pentru evaluarea funcției Q. La actualizare, se ia valoarea minimă dintre cele două, ceea ce reduce supraestimarea valorilor Q.

  2. Actualizări întârziate ale politicii (Delayed Policy Updates): Politica este actualizată mai rar decât criticii (de exemplu, de 2-3 ori mai rar), ceea ce stabilizează învățarea.

  3. Adăugarea de zgomot la acțiuni în timpul antrenamentului criticilor (Target Policy Smoothing): Se adaugă un zgomot mic la acțiunile generate de politica țintă, prevenind supraînvățarea excesivă pe valori punctuale și îmbunătățind generalizarea.

Aceste îmbunătățiri fac ca TD3 să fie mai stabil și mai eficient comparativ cu DDPG clasic.