Sobes.tech
Middle — Senior

TD3 чист ва чӣ се беҳбудиро ба DDPG ворид мекунад?

sobes.tech AI

Ҷавоб аз AI

TD3 (Twin Delayed Deep Deterministic policy gradient) беҳбудии алгоритми DDPG (Deep Deterministic Policy Gradient) барои омӯзиши бо такдири дар вазифаҳои бо фазои амалҳои пайваста. TD3 се беҳбудии асосиро ворид мекунад:

  1. Дугонаи танқидҳо (Twin Critics): Ду шабакаи нейронӣ барои арзёбии функсияи Q истифода мешаванд. Дар навсозӣ, арзиши хурдтарин аз онҳо гирифта мешавад, ки аз ҳад зиёд арзёбии арзишҳои Q кам мекунад.

  2. Навсозии сиёсати дертар (Delayed Policy Updates): Сиёсат камтар аз танқидҳо навсозӣ мешавад (масалан, 2-3 маротиба камтар), ки омӯзишро устувор мекунад.

  3. Илова кардани садо ба амалҳо дар вақти омӯзиши танқидҳо (Target Policy Smoothing): Ба амалҳое, ки сиёсати ҳадафӣ истеҳсол мекунад, садои хурд илова мешавад, ки аз ҳад зиёд омӯхтани нуқтаӣ пешгирӣ мекунад ва умумӣ карданиро беҳтар мекунад.

Ин беҳбудиҳо TD3-ро нисбат ба DDPG классикӣ бештар устувор ва самаранок месозанд.