TD3 nima va u DDPG ga qanday uchta yaxshilash kiritadi?
sobes.tech AI
AIdan javob
TD3 (Twin Delayed Deep Deterministic policy gradient) - bu uzlullash DDPG (Deep Deterministic Policy Gradient) algoritmining takomilidir, ularning uzluksiz harakatlar maydonidagi mustahkam o‘rganish uchun. TD3 uchta asosiy yaxshilashni kiritadi:
-
Ikki marta kritik (Twin Critics): Q-funksiyasini baholash uchun ikki neyron tarmoq kritik ishlatiladi. Yangilashda, ikkisining minimal qiymati olinadi, bu esa Q-qiymatlarning ortiqcha baholanishini kamaytiradi.
-
Keçiktirilgan siyosat yangilanishlari (Delayed Policy Updates): Siyosat, kritiklardan kamroq yangilanadi (masalan, 2-3 marta kamroq), bu esa o‘qitishni barqarorlashtiradi.
-
Kritiklarni o‘qitishda harakatlarga shovqin qo‘shish (Target Policy Smoothing): Maqsad siyosat tomonidan ishlab chiqarilgan harakatlarga kichik shovqin qo‘shiladi, bu esa ortiqcha moslashishni oldini oladi va umumiylashishni yaxshilaydi.
Ushbu yaxshilashlar TD3ni klassik DDPGga nisbatan yanada barqaror va samarali qiladi.