Kas yra TD3 ir kokius tris patobulinimus jis įneša į DDPG?
sobes.tech AI
Atsakymas iš AI
TD3 (Twin Delayed Deep Deterministic policy gradient) yra patobulinimas DDPG (Deep Deterministic Policy Gradient) algoritmo, skirtas stiprinimo mokymuisi tęstinio veiksmo erdvėje. TD3 įveda tris pagrindinius patobulinimus:
-
Dvigubi kritikai (Twin Critics): Naudojamos dvi neuroninės tinklai kritikai vertinti Q funkciją. Atnaujinimo metu imama mažiausia iš jų, tai sumažina Q reikšmių pervertinimą.
-
Atidėtas politikos atnaujinimas (Delayed Policy Updates): Politika atnaujinama rečiau nei kritikai (pavyzdžiui, 2-3 kartus rečiau), tai stabilizuoja mokymąsi.
-
Triukšmo pridėjimas prie veiksmų mokymo metu (Target Policy Smoothing): Pridedamas mažas triukšmas prie tikslo politikos generuotų veiksmų, tai užkerta kelią per dideliam pritaikymui ir gerina bendrąją generalizaciją.
Šie patobulinimai daro TD3 stabilesnį ir efektyvesnį nei klasikinis DDPG.