Czym jest TD3 i jakie trzy ulepszenia wprowadza do DDPG?
sobes.tech AI
Odpowiedź od AI
TD3 (Twin Delayed Deep Deterministic policy gradient) to ulepszenie algorytmu DDPG (Deep Deterministic Policy Gradient) do uczenia się ze wzmocnieniem w zadaniach z ciągłą przestrzenią działań. TD3 wprowadza trzy kluczowe ulepszenia:
-
Podwójne krytyki (Twin Critics): Używane są dwie sieci neuronowe krytyka do oceny funkcji Q. Podczas aktualizacji wybierana jest minimalna wartość spośród nich, co zmniejsza nadmierną wycenę wartości Q.
-
Opóźnione aktualizacje polityki (Delayed Policy Updates): Polityka jest aktualizowana rzadziej niż krytyki (np. 2-3 razy rzadziej), co stabilizuje proces uczenia.
-
Dodanie szumu do działań podczas uczenia krytyków (Target Policy Smoothing): Do działań generowanych przez politykę docelową dodawany jest niewielki szum, co zapobiega nadmiernemu dopasowaniu do punktowych wartości i poprawia uogólnienie.
Te ulepszenia sprawiają, że TD3 jest bardziej stabilny i wydajny w porównaniu z klasycznym DDPG.