Enfoque distribucional en aprendizaje por refuerzo acelera entrenamientos
Línea temporal
-
DeepMind publica método distribucional para entrenamientos más rápidos en aprendizaje por refuerzo
Google DeepMind ha publicado un paper que propone reemplazar el enfoque tradicional de predecir el promedio de recompensas en aprendizaje por refuerzo (RL) por uno que modela la distribución completa de resultados. Los…