Sobes.tech
Middle — Senior

TD3 nədir və DDPG-yə hansı üç təkmilləşdirməni gətirir?

sobes.tech Süni İntellekt

AI-dan cavab

TD3 (Twin Delayed Deep Deterministic policy gradient) algoritminin təkmilləşdirilməsidir, davamlı hərəkət sahəsində möhkəm öyrənmə üçün DDPG (Deep Deterministic Policy Gradient) algoritminə. TD3 üç əsas təkmilləşdirmə gətirir:

  1. İkiqat tənqidçilər (Twin Critics): Q funksiyasını qiymətləndirmək üçün iki neyron şəbəkə tənqidçisi istifadə olunur. Yeniləmədə, ikisinin minimum dəyəri götürülür, bu da Q dəyərlərinin artıq qiymətləndirilməsini azaldır.

  2. Gecikmiş siyasət yeniləmələri (Delayed Policy Updates): Siyasət, tənqidçilərdən daha az tezliklə yenilənir (məsələn, 2-3 dəfə daha az), bu da öyrənmə prosesini stabilləşdirir.

  3. Tənqidçilərin təlimində hərəkətlərə səs əlavə etmək (Target Policy Smoothing): Hədəf siyasət tərəfindən yaradılan hərəkətlərə kiçik bir səs əlavə olunur, bu da çox öyrənmənin qarşısını alır və ümumiləşdirməni yaxşılaşdırır.

Bu təkmilləşdirmələr TD3-ü klassik DDPG ilə müqayisədə daha stabil və səmərəli edir.