Sobes.tech
Middle — Senior

Čo je TD3 a aké tri vylepšenia prináša do DDPG?

sobes.tech AI

Odpoveď od AI

TD3 (Twin Delayed Deep Deterministic policy gradient) je izboljšava algoritma DDPG (Deep Deterministic Policy Gradient) za učenje z okrepitvenim učenjem v nalogah s kontinuiranim prostorom dejanj. TD3 uvaja tri ključne izboljšave:

  1. Dvojni kritiki (Twin Critics): Uporabljata se dve nevronski mreži kritika za oceno funkcije Q. Pri posodabljanju se vzame minimalna vrednost obeh, kar zmanjša precenjevanje Q-vrednosti.

  2. Zamujene posodobitve politike (Delayed Policy Updates): Politika se posodablja redkeje kot kritiki (na primer, 2-3 krat redkeje), kar stabilizira učenje.

  3. Dodajanje šuma k dejanjem med usposabljanjem kritik (Target Policy Smoothing): K dejanjem, ki jih generira ciljna politika, se doda majhen šum, kar preprečuje prekomerno učenje na točkovnih vrednostih in izboljšuje posploševanje.

Te izboljšave naredijo TD3 bolj stabilen in učinkovit v primerjavi s klasičnim DDPG-jem.