Sobes.tech
Middle — Senior

Kas yra DQN ir kokias problemas jis sprendžia palyginti su Q-learning?

sobes.tech AI

Atsakymas iš AI

DQN (Deep Q-Network) yra stiprinimo mokymosi algoritmas, kuris naudoja neuroninį tinklą Q-funkcijos apytiksliai nustatyti, skirtingai nuo klasikinio Q-mokymosi, kuris saugo Q reikšmes lentelėje.

Klasikinio Q-mokymosi problemos:

  • Neefektyvus dideliuose arba nuosekliuose būsenų erdvėse, nes Q lentelė tampa pernelyg didelė arba neįmanoma jos išsaugoti.
  • Negali apibendrinti žinių tarp panašių būsenų.

DQN sprendžia šias problemas naudodamas:

  • Gilią neuroninę tinklą Q-funkcijai apytiksliai nustatyti, leidžiantį dirbti su aukštos dimensijos ir nuosekliomis būsenomis.
  • Patirties atkūrimo mechanizmą (experience replay), kuris saugo praeities perėjimus ir mokosi iš atsitiktinių mini-partijų, sumažindamas sekcinių duomenų koreliaciją ir stabilizuodamas mokymąsi.
  • Naudodamas tikslo tinklą (target network), kuris atnaujinamas rečiau, siekiant stabilizuoti tikslo reikšmes mokymosi metu.

Taip DQN leidžia taikyti Q-mokymą sudėtingoms užduotims su didelėmis būsenų erdvėmis, pavyzdžiui, žaidimams su įvesties vaizdais.