Aprendizaje por refuerzo guiado por retroalimentación humana
Resumen En qué punto está
DeepMind y OpenAI han publicado métodos para entrenar agentes de aprendizaje por refuerzo usando retroalimentación humana no experta en lugar de funciones de recompensa explícitas. El primer trabajo muestra que 30 minutos de comparaciones de comportamientos por parte de usuarios sin experiencia técnica bastan para enseñar tareas complejas. El segundo, ReQueST de DeepMind, aborda el problema de la exploración segura generando comportamientos sintéticos simulados para evitar visitar estados inseguros durante el entrenamiento. Ambas técnicas se validaron en entornos de videojuegos y simulaciones robóticas.
Resumen generado mediante IA a partir de las 2 noticias de la historia. Última actualización: hace 1 h.
Línea temporal
-
DeepMind presenta ReQueST para entrenar agentes de RL desde retroalimentación humana sin estados inseguros
Google DeepMind ha publicado un método llamado ReQueST (Reward Query Synthesis via Trajectory Optimisation) que permite entrenar agentes de aprendizaje por refuerzo desde retroalimentación humana en presencia de estados…
-
DeepMind y OpenAI publican técnica para entrenar IA desde retroalimentación humana sin expertos
DeepMind y OpenAI han publicado investigación sobre un método que permite a usuarios sin experiencia técnica enseñar sistemas de aprendizaje por refuerzo a través de retroalimentación humana. El sistema, denominado Deep…