Sobes.tech
Middle — Senior

¿Qué es TD3 y qué tres mejoras aporta a DDPG?

sobes.tech AI

Respuesta de la IA

TD3 (Twin Delayed Deep Deterministic policy gradient) es una mejora del algoritmo DDPG (Deep Deterministic Policy Gradient) para el aprendizaje por refuerzo en tareas con espacio de acciones continuo. TD3 introduce tres mejoras clave:

  1. Criticos dobles (Twin Critics): Se utilizan dos redes neuronales critic para evaluar la función Q. Al actualizar, se toma el valor mínimo de los dos, lo que reduce la sobreestimación de los valores Q.

  2. Actualizaciones de política retrasadas (Delayed Policy Updates): La política se actualiza con menos frecuencia que los critic (por ejemplo, 2-3 veces menos), lo que estabiliza el entrenamiento.

  3. Adición de ruido a las acciones durante el entrenamiento de los critic (Target Policy Smoothing): Se añade un pequeño ruido a las acciones generadas por la política objetivo, lo que previene el sobreajuste excesivo a valores puntuales y mejora la generalización.

Estas mejoras hacen que TD3 sea más estable y eficiente en comparación con el DDPG clásico.