Ir al contenido
IA para hoy
Cerrada 2 noticias · 1 fuentesdel 6 jul al 6 jul

Aprendizaje por refuerzo guiado por retroalimentación humana

Resumen En qué punto está

DeepMind y OpenAI han publicado métodos para entrenar agentes de aprendizaje por refuerzo usando retroalimentación humana no experta en lugar de funciones de recompensa explícitas. El primer trabajo muestra que 30 minutos de comparaciones de comportamientos por parte de usuarios sin experiencia técnica bastan para enseñar tareas complejas. El segundo, ReQueST de DeepMind, aborda el problema de la exploración segura generando comportamientos sintéticos simulados para evitar visitar estados inseguros durante el entrenamiento. Ambas técnicas se validaron en entornos de videojuegos y simulaciones robóticas.

Resumen generado mediante IA a partir de las 2 noticias de la historia. Última actualización: hace 1 h.

Línea temporal

  1. Google DeepMindFiabilidad confirmado por varias fuentes

    DeepMind presenta ReQueST para entrenar agentes de RL desde retroalimentación humana sin estados inseguros

    Google DeepMind ha publicado un método llamado ReQueST (Reward Query Synthesis via Trajectory Optimisation) que permite entrenar agentes de aprendizaje por refuerzo desde retroalimentación humana en presencia de estados…

  2. Google DeepMindFiabilidad confirmado por varias fuentes

    DeepMind y OpenAI publican técnica para entrenar IA desde retroalimentación humana sin expertos

    DeepMind y OpenAI han publicado investigación sobre un método que permite a usuarios sin experiencia técnica enseñar sistemas de aprendizaje por refuerzo a través de retroalimentación humana. El sistema, denominado Deep…