Límites expresivos de funciones de recompensa Markov en RL
Línea temporal
-
Google DeepMind estudia los límites expresivos de funciones de recompensa en aprendizaje reforzado
Google DeepMind publica un trabajo teórico que examina los límites fundamentales de las funciones de recompensa (Markov reward) en aprendizaje por refuerzo. El estudio prueba que, aunque las recompensas pueden expresar…