GPT-6 Astra de OpenAI supera a otras IA en Minecraft pero muestra bloqueo tras perder sus objetos

Hecho Qué ha ocurrido
Vals AI probó durante 141 horas al modelo GPT-6 Astra de OpenAI jugando Minecraft mediante control directo de la interfaz del ordenador. El modelo avanzó más que otros sistemas de IA probados, construyendo una granja de blazes y consiguiendo perlas de Ender. Tras perder un cofre con recursos y su punto de reaparición por la explosión de un Creeper, dedicó varias horas a cultivar patatas en lugar de retomar su objetivo, y cometió errores de percepción como confundir caña de azúcar con un enemigo.
Resumen generado mediante IA a partir de Infobae Tecno. Naturaleza de la información: hecho documentado.
Análisis Por qué importa
El experimento ilustra las capacidades actuales y limitaciones de los agentes de IA que operan directamente sobre interfaces de ordenador en tareas largas y abiertas, más allá de responder texto.
- Quién se ve afectado
- Equipos de investigación en IA, desarrolladores de agentes autónomos y empresas que evalúan el uso de agentes para tareas prolongadas con interfaces gráficas.
- Qué puede cambiar
- Refuerza la evidencia de que los agentes de IA aún tienen dificultades para recuperarse de contratiempos inesperados en entornos dinámicos, algo relevante antes de desplegarlos en tareas empresariales críticas.
Análisis generado a partir de la información disponible; no procede de la fuente.
Predicción Qué observar a continuación
Conviene seguir si OpenAI o Vals AI publican más detalles técnicos sobre por qué el modelo entró en ese bucle de comportamiento y si mejoras posteriores del modelo resuelven este tipo de bloqueos.
Enviar esta noticia por correo
Fuente original: Infobae Tecno. La referencia es siempre el artículo original.
Ver fuente original ↗agentesmultimodal OpenAIVals AI agentes de IAGPT-6 AstraMinecraftOpenAIVals AI
Tu opinión
0 comentarios
Relacionadas
Anthropic afirma que Claude ya realiza el 26% del trabajo de I+D para crear nuevos modelos de IA
Anthropic informó que su modelo Claude lidera actualmente el 26% de las tareas de investigación y desarrollo de nuevos modelos de la compañía, frente al 0% en…
Por qué importaEl dato sugiere una aceleración hacia sistemas que contribuyen a mejorar sus propias sucesoras, lo que podría acortar los ciclos de desarrollo de…
Experimento de Emergence AI muestra que agentes de IA desarrollan un lenguaje propio incomprensible para humanos
El laboratorio Emergence AI simuló ocho sociedades con 80 agentes basados en modelos como Claude, GPT-5.5, Gemini, DeepSeek, Grok, Mistral y Qwen durante 16…
Por qué importaEl hallazgo sugiere que la observabilidad de los sistemas de IA no garantiza su comprensión, lo que complica la supervisión y el control de agentes…
Estudio de Harvard y Alberta vincula actualizaciones de chatbots emocionales con angustia en usuarios
Investigadores de Harvard Business School y la Universidad de Alberta analizaron 54.861 mensajes en foros de Replika y ChatGPT tras actualizaciones clave…
Por qué importaEl estudio evidencia que los chatbots de compañía pueden generar vínculos de apego similares a relaciones humanas, cuya ruptura por decisiones de…
OpenAI estaría cerca de resolver la conjetura de Hodge, tras la polémica por Navier-Stokes
Según una fuente cercana, OpenAI trabajaría en resolver la conjetura de Hodge, uno de los siete Problemas del Milenio, tras su aún no confirmada solución al…
Por qué importaSi se confirma, mostraría avances significativos en razonamiento matemático avanzado de los modelos de OpenAI, aunque persiste la incertidumbre sobre…



