TD3 nedir ve DDPG'ye hangi üç geliştirmeyi getiriyor?
sobes.tech yapay zeka
AI'dan gelen yanıt
TD3 (Twin Delayed Deep Deterministic policy gradient), sürekli eylem alanına sahip görevlerde pekiştirmeli öğrenme için DDPG (Deep Deterministic Policy Gradient) algoritmasının bir geliştirmesidir. TD3 üç temel iyileştirme getirir:
-
Çift Eleştirmenler (Twin Critics): Q fonksiyonunu değerlendirmek için iki sinir ağı eleştirmen kullanılır. Güncelleme sırasında, ikisinin minimum değeri alınır, bu da Q değerlerinin aşırı tahmin edilmesini azaltır.
-
Gecikmeli Politika Güncellemeleri (Delayed Policy Updates): Politika, eleştirmenlerden daha az sıklıkta güncellenir (örneğin, 2-3 kat daha az), bu da eğitimi stabilize eder.
-
Eleştirmenlerin eğitiminde eylemlere gürültü ekleme (Target Policy Smoothing): Hedef politika tarafından üretilen eylemlere küçük bir gürültü eklenir, bu da aşırı uyumu önler ve genelleştirmeyi artırır.
Bu iyileştirmeler, TD3'ü klasik DDPG'ye kıyasla daha stabil ve verimli hale getirir.