Kas ir TD3 un kādas trīs uzlabojumus tas ievieš DDPG?
sobes.tech AI
Atbilde no AI
TD3 (Twin Delayed Deep Deterministic policy gradient) ir uzlabo DDPG (Deep Deterministic Policy Gradient) algoritmu, kas ir stiprināšanas mācīšanās ar nepārtrauktu darbību telpu. TD3 ievieš trīs galvenos uzlabojumus:
-
Duple kritiķi (Twin Critics): Tiek izmantotas divas neironu tīklu kritikas, lai novērtētu Q funkciju. Atjaunināšanas laikā tiek ņemta minimālā no tām, kas samazina Q vērtību pārvērtēšanu.
-
Aizkavētas politikas atjaunināšanas (Delayed Policy Updates): Politika tiek atjaunināta retāk nekā kritikas (piemēram, 2-3 reizes retāk), kas stabilizē mācīšanos.
-
Skaņas pievienošana darbībām mācību laikā (Target Policy Smoothing): Pie darbībām, ko ģenerē mērķa politika, tiek pievienots mazs troksnis, kas novērš pārmērīgu pārpraksi un uzlabo vispārējo generalizāciju.
Šie uzlabojumi padara TD3 stabilāku un efektīvāku salīdzinājumā ar klasisko DDPG.