Čo je TD3 a aké tri vylepšenia prináša do DDPG?
sobes.tech AI
Odpoveď od AI
TD3 (Twin Delayed Deep Deterministic policy gradient) je izboljšava algoritma DDPG (Deep Deterministic Policy Gradient) za učenje z okrepitvenim učenjem v nalogah s kontinuiranim prostorom dejanj. TD3 uvaja tri ključne izboljšave:
-
Dvojni kritiki (Twin Critics): Uporabljata se dve nevronski mreži kritika za oceno funkcije Q. Pri posodabljanju se vzame minimalna vrednost obeh, kar zmanjša precenjevanje Q-vrednosti.
-
Zamujene posodobitve politike (Delayed Policy Updates): Politika se posodablja redkeje kot kritiki (na primer, 2-3 krat redkeje), kar stabilizira učenje.
-
Dodajanje šuma k dejanjem med usposabljanjem kritik (Target Policy Smoothing): K dejanjem, ki jih generira ciljna politika, se doda majhen šum, kar preprečuje prekomerno učenje na točkovnih vrednostih in izboljšuje posploševanje.
Te izboljšave naredijo TD3 bolj stabilen in učinkovit v primerjavi s klasičnim DDPG-jem.