TD3 nədir və DDPG-yə hansı üç təkmilləşdirməni gətirir?
sobes.tech Süni İntellekt
AI-dan cavab
TD3 (Twin Delayed Deep Deterministic policy gradient) algoritminin təkmilləşdirilməsidir, davamlı hərəkət sahəsində möhkəm öyrənmə üçün DDPG (Deep Deterministic Policy Gradient) algoritminə. TD3 üç əsas təkmilləşdirmə gətirir:
-
İkiqat tənqidçilər (Twin Critics): Q funksiyasını qiymətləndirmək üçün iki neyron şəbəkə tənqidçisi istifadə olunur. Yeniləmədə, ikisinin minimum dəyəri götürülür, bu da Q dəyərlərinin artıq qiymətləndirilməsini azaldır.
-
Gecikmiş siyasət yeniləmələri (Delayed Policy Updates): Siyasət, tənqidçilərdən daha az tezliklə yenilənir (məsələn, 2-3 dəfə daha az), bu da öyrənmə prosesini stabilləşdirir.
-
Tənqidçilərin təlimində hərəkətlərə səs əlavə etmək (Target Policy Smoothing): Hədəf siyasət tərəfindən yaradılan hərəkətlərə kiçik bir səs əlavə olunur, bu da çox öyrənmənin qarşısını alır və ümumiləşdirməni yaxşılaşdırır.
Bu təkmilləşdirmələr TD3-ü klassik DDPG ilə müqayisədə daha stabil və səmərəli edir.