Google DeepMind presenta PopArt: técnica para entrenar un solo agente en múltiples tareas
Google DeepMind ha publicado PopArt, una técnica de normalización adaptativa de recompensas para aprendizaje por refuerzo multi-tarea. El método permite a un…
Por qué importaPopArt resuelve un problema técnico fundamental en RL multi-tarea: el desbalance de escalas de recompensa que obliga a elegir entre optimizar bien…
Impacto medio
Fiabilidad fuente primaria
Google DeepMind