Mis on TD3 ja milliseid kolme täiustust see DDPG-sse toob?
sobes.tech AI
Vastus AI-lt
TD3 (Twin Delayed Deep Deterministic policy gradient) on täiustatus DDPG (Deep Deterministic Policy Gradient) algoritmile tugevdamisõppimises pideva tegevusruumi ülesannetes. TD3 toob kaasa kolm peamist täiustust:
-
Topeltkriitikud (Twin Critics): Kasutatakse kahte närvivõrku kriitikud Q-funktsiooni hindamiseks. Uuendamisel võetakse väikseim väärtus nende kahe hulgast, mis vähendab Q-väärtuste ülehindamist.
-
Viivitusega poliitika uuendused (Delayed Policy Updates): Poliitika uuendatakse harvemini kui kriitikud (näiteks 2-3 korda harvemini), mis stabiliseerib õppimisprotsessi.
-
Müra lisamine tegevustele kriitikute koolitamisel (Target Policy Smoothing): Väike müra lisatakse sihtpoliitika poolt genereeritud tegevustele, mis takistab ülemäärast üleõppimist ja parandab üldistamist.
Need täiustused muudavad TD3-st stabiilsema ja tõhusama võrreldes klassikalise DDPG-ga.