DeepMind presenta A-OPS para selección eficiente de políticas en RL
Línea temporal
-
DeepMind propone A-OPS para seleccionar políticas de RL en robótica con mínimas interacciones
Google DeepMind ha propuesto Active Offline Policy Selection (A-OPS), un método que permite seleccionar la mejor política de aprendizaje por refuerzo para despliegue en aplicaciones como robótica con un número mínimo de…