Co je TD3 a jaké tři vylepšení přináší do DDPG?
sobes.tech AI
Odpověď od AI
TD3 (Twin Delayed Deep Deterministic policy gradient) je vylepšením algoritmu DDPG (Deep Deterministic Policy Gradient) pro posilované učení v úlohách s kontinuálním prostorem akcí. TD3 přináší tři klíčová vylepšení:
-
Dvojí kritici (Twin Critics): Používají se dvě neuronové sítě kritika k hodnocení funkce Q. Při aktualizaci se vezme minimální hodnota z obou, což snižuje nadhodnocení hodnot Q.
-
Zpožděné aktualizace politiky (Delayed Policy Updates): Politika se aktualizuje méně často než kritici (například 2-3krát méně), což stabilizuje učení.
-
Přidání šumu k akcím při tréninku kritiků (Target Policy Smoothing): K akcím generovaným cílovou politikou se přidá malý šum, což zabraňuje přetrénování na konkrétních hodnotách a zlepšuje generalizaci.
Tato vylepšení činí TD3 stabilnějším a efektivnějším ve srovnání s klasickým DDPG.