PopArt: normalización adaptativa para entrenamiento multi-tarea en RL
Línea temporal
-
Google DeepMind presenta PopArt: técnica para entrenar un solo agente en múltiples tareas
Google DeepMind ha publicado PopArt, una técnica de normalización adaptativa de recompensas para aprendizaje por refuerzo multi-tarea. El método permite a un único agente alcanzar rendimiento sobrehumano en 57 juegos…