Sobes.tech
Middle — Senior

Шабакаи ҳадаф дар DQN чист?

sobes.tech AI

Ҷавоб аз AI

شبکه هدف در DQN یک نسخه کپی از شبکه عصبی اصلی است که برای محاسبه مقادیر هدف تابع Q در طول آموزش استفاده می‌شود. این شبکه کمتر از شبکه اصلی به‌روزرسانی می‌شود (مثلاً هر چند هزار گام)، که به تثبیت آموزش و جلوگیری از واگرایی کمک می‌کند. ایده این است که شبکه هدف ثابت، هدفی پایدارتر برای به‌روزرسانی پارامترهای شبکه اصلی فراهم می‌کند.

نمونه‌ای از به‌روزرسانی شبکه هدف:

if step % target_update_freq == 0:
    target_network.load_state_dict(main_network.state_dict())