Šta je TD3 i koja su tri poboljšanja koja on unosi u DDPG?
sobes.tech АИ
Одговор од АИ
TD3 (Twin Delayed Deep Deterministic policy gradient) je poboljšanje algoritma DDPG (Deep Deterministic Policy Gradient) za učenje putem pojačanja u zadacima s kontinuiranim prostorom akcija. TD3 uvodi tri ključne poboljšanja:
-
Duple kritike (Twin Critics): Koriste se dve neuronske mreže kritike za procenu Q-funkcije. Pri ažuriranju se uzima minimalna vrednost od njih, čime se smanjuje precenjivanje Q-vrednosti.
-
Odložena ažuriranja politike (Delayed Policy Updates): Politika se ažurira ređe nego kritike (na primer, 2-3 puta ređe), što stabilizuje učenje.
-
Dodavanje šuma u akcije tokom obuke kritika (Target Policy Smoothing): Mali šum se dodaje akcijama koje generiše ciljna politika, čime se sprečava prekomerno preučenje i poboljšava generalizacija.
Ova poboljšanja čine TD3 stabilnijim i efikasnijim u poređenju s klasičnim DDPG-jem.