Middle — Senior
Шабакаи ҳадаф дар DQN чист?
sobes.tech AI
Ҷавоб аз AI
شبکه هدف در DQN یک نسخه کپی از شبکه عصبی اصلی است که برای محاسبه مقادیر هدف تابع Q در طول آموزش استفاده میشود. این شبکه کمتر از شبکه اصلی بهروزرسانی میشود (مثلاً هر چند هزار گام)، که به تثبیت آموزش و جلوگیری از واگرایی کمک میکند. ایده این است که شبکه هدف ثابت، هدفی پایدارتر برای بهروزرسانی پارامترهای شبکه اصلی فراهم میکند.
نمونهای از بهروزرسانی شبکه هدف:
if step % target_update_freq == 0:
target_network.load_state_dict(main_network.state_dict())