Какво е TD3 и какви три подобрения въвежда в DDPG?
sobes.tech AI
Отговор от AI
TD3 (Twin Delayed Deep Deterministic policy gradient) е подобрение на алгоритъма DDPG (Deep Deterministic Policy Gradient) за обучение с подсилване в задачи с непрекъснато пространство на действията. TD3 въвежда три ключови подобрения:
-
Двойни критики (Twin Critics): Използват се две невронни мрежи-критик за оценка на Q-функцията. При актуализация се взема минималната стойност от двете, което намалява преоценката на Q-стойностите.
-
Забавени актуализации на политиката (Delayed Policy Updates): Политиката се актуализира по-рядко от критиците (например, 2-3 пъти по-рядко), което стабилизира обучението.
-
Добавяне на шум към действията при обучение на критиците (Target Policy Smoothing): Към действията, генерирани от целевата политика, се добавя малък шум, което предотвратява прекомерното пренасищане и подобрява обобщението.
Тези подобрения правят TD3 по-стабилен и ефективен в сравнение с класическия DDPG.