Middle — Senior
Co je Double DQN a jaký problém řeší?
sobes.tech AI
Odpověď od AI
Double DQN (Double Deep Q-Network) je vylepšením klasického algoritmu DQN v oblasti učení s posilováním. Hlavním problémem, který Double DQN řeší, je přeceňování hodnot Q-funkce, ke kterému dochází u standardního DQN kvůli použití stejného hodnotícího neuronového sítě pro výběr a hodnocení akce.
Double DQN rozděluje tyto dvě úkoly: jedna síť vybírá akci s maximální hodnotou Q, zatímco druhá hodnotí tuto akci. To snižuje zkreslení a vede k stabilnějšímu a přesnějšímu učení.
Příklad:
- V DQN: target = reward + gamma * max_a' Q(next_state, a')
- V Double DQN: target = reward + gamma * Q_target(next_state, argmax_a' Q_online(next_state, a'))
Kde Q_online je hlavní síť vybírající akci, a Q_target je cílová síť hodnotící vybranou akci.