R2D3: agente de RL con demostraciones para exploración en entornos complejos
Línea temporal
-
DeepMind presenta R2D3, agente de aprendizaje por refuerzo con demostraciones para tareas complejas
DeepMind ha publicado R2D3 (Recurrent Replay Distributed DQN from Demonstrations), un agente de aprendizaje por refuerzo diseñado para resolver tareas con recompensas escasas en entornos parcialmente observables con…