Ir al contenido
IA para hoy
Modelos y avances Benchmark

GPT-6 Astra completa Portal de principio a fin sin ayuda humana en 24 horas

Imagen: The Decoder

Hecho Qué ha ocurrido

El desarrollador cozyblaze publicó en X y GitHub un experimento en el que GPT-6 Astra jugó y completó el videojuego Portal de forma autónoma tras recibir un objetivo inicial, sin intervención humana posterior. El proceso tardó unas 23 horas y 43 minutos, con un coste estimado de al menos 570 dólares en tokens al precio de lista de Astra. El agente controla el juego mediante MCP y una herramienta modificada que pausa el juego para analizar capturas de pantalla, posición y cámara antes de decidir cada acción.

Resumen generado mediante IA a partir de The Decoder (original en inglés). Naturaleza de la información: declaración de parte interesada.

Análisis Por qué importa

Demuestra capacidades de planificación y ejecución autónoma a largo plazo en entornos interactivos complejos, un paso hacia agentes generales capaces de resolver tareas multi-hora sin supervisión.

Quién se ve afectado
Equipos de investigación en IA, desarrolladores de videojuegos y empresas que exploran agentes autónomos para tareas complejas.
Qué puede cambiar
Se refuerza la idea de que los modelos actuales pueden mantener coherencia y razonamiento durante sesiones muy largas, lo que podría trasladarse a tareas empresariales de larga duración con supervisión mínima.

Análisis generado a partir de la información disponible; no procede de la fuente.

Predicción Qué observar a continuación

Vigilar si OpenAI confirma oficialmente estas capacidades de Astra, y si aparecen más demostraciones de agentes completando tareas complejas de forma autónoma en otros dominios además de videojuegos.

Fuente original: The Decoder. La referencia es siempre el artículo original.

Ver fuente original ↗

agentesLLM agentes autónomosGPT-6 AstraOpenAIPortalvideojuegos

Relacionadas

OpenAI lanza Daybreak: 1.000 millones en ciberseguridad subsidiada el mismo día que GPT-6 Astra

OpenAI anunció el 4 de septiembre el programa Daybreak for Frontline Defenders, con 1.000 millones de dólares en acceso subsidiado (créditos de API, modelos…

Por qué importaMuestra cómo los laboratorios de IA vinculan el lanzamiento de modelos con mayores capacidades ofensivas a programas de mitigación defensiva, una…

Impacto medio Fiabilidad confirmado por varias fuentes WWWhat's new
Modelos y avances 5 fuentes

OpenAI lanza GPT-6 Astra con récord de benchmarks, salvaguardas de ciberseguridad y disculpa por rollout caótico

OpenAI lanzó el 3 de septiembre GPT-6 Astra, el primer modelo que cruza el umbral 'Critical' de ciberseguridad en su Preparedness Framework, con ExploitBench…

Por qué importaEs el primer modelo de frontera que documenta explícitamente capacidades ofensivas críticas junto a limitaciones de supervisión, lo que tensiona el…

Impacto muy alto Fiabilidad confirmado por varias fuentes WWWhat's new
Herramientas y productos 5 fuentes

Check Point integra modelos de razonamiento de OpenAI en su plataforma Daybreak de ciberseguridad

Check Point Software ha reforzado su alianza con OpenAI para lanzar Daybreak, una serie de modelos de razonamiento cibernético ya disponibles en su plataforma…

Por qué importaLa combinación de modelos de razonamiento de frontera con telemetría propia de seguridad busca reducir el ruido de alertas y priorizar riesgos…

Impacto medio Fiabilidad confirmado por varias fuentes Computerworld España
Herramientas y productos 5 fuentes

OpenAI lanza GPT-5.6-Cyber para investigadores de seguridad con acceso a vulnerabilidades

OpenAI ha lanzado GPT-5.6-Cyber, un modelo especializado en ciberseguridad basado en GPT-5.6 Sol con restricciones reducidas para tareas de seguridad ofensiva…

Por qué importaA medida que los modelos de IA se vuelven más capaces de detectar y exploitar vulnerabilidades, los equipos defensivos necesitan herramientas…

Impacto alto Fiabilidad confirmado por varias fuentes Hipertextual