Sobes.tech
Middle — Senior

Šta je TD3 i koja su tri poboljšanja koja on unosi u DDPG?

sobes.tech АИ

Одговор од АИ

TD3 (Twin Delayed Deep Deterministic policy gradient) je poboljšanje algoritma DDPG (Deep Deterministic Policy Gradient) za učenje putem pojačanja u zadacima s kontinuiranim prostorom akcija. TD3 uvodi tri ključne poboljšanja:

  1. Duple kritike (Twin Critics): Koriste se dve neuronske mreže kritike za procenu Q-funkcije. Pri ažuriranju se uzima minimalna vrednost od njih, čime se smanjuje precenjivanje Q-vrednosti.

  2. Odložena ažuriranja politike (Delayed Policy Updates): Politika se ažurira ređe nego kritike (na primer, 2-3 puta ređe), što stabilizuje učenje.

  3. Dodavanje šuma u akcije tokom obuke kritika (Target Policy Smoothing): Mali šum se dodaje akcijama koje generiše ciljna politika, čime se sprečava prekomerno preučenje i poboljšava generalizacija.

Ova poboljšanja čine TD3 stabilnijim i efikasnijim u poređenju s klasičnim DDPG-jem.