Sobes.tech
Middle — Senior

Co je TD3 a jaké tři vylepšení přináší do DDPG?

sobes.tech AI

Odpověď od AI

TD3 (Twin Delayed Deep Deterministic policy gradient) je vylepšením algoritmu DDPG (Deep Deterministic Policy Gradient) pro posilované učení v úlohách s kontinuálním prostorem akcí. TD3 přináší tři klíčová vylepšení:

  1. Dvojí kritici (Twin Critics): Používají se dvě neuronové sítě kritika k hodnocení funkce Q. Při aktualizaci se vezme minimální hodnota z obou, což snižuje nadhodnocení hodnot Q.

  2. Zpožděné aktualizace politiky (Delayed Policy Updates): Politika se aktualizuje méně často než kritici (například 2-3krát méně), což stabilizuje učení.

  3. Přidání šumu k akcím při tréninku kritiků (Target Policy Smoothing): K akcím generovaným cílovou politikou se přidá malý šum, což zabraňuje přetrénování na konkrétních hodnotách a zlepšuje generalizaci.

Tato vylepšení činí TD3 stabilnějším a efektivnějším ve srovnání s klasickým DDPG.