GPT-6 Astra de OpenAI: benchmarks, precios y comparación con Claude Fable
Hecho Qué ha ocurrido
OpenAI ha comenzado a desplegar GPT-6 Astra, primero a organizaciones limitadas y próximamente a usuarios de ChatGPT Plus, Pro, Business y Enterprise, además de vía API y AWS. El precio de API es de 10 dólares por millón de tokens de entrada y 50 por millón de salida, igual que Claude Fable 5. Astra logra 99,9% en ARC-AGI 3 usando un harness propietario de OpenAI (frente a 62,7% con el harness estándar), y destaca en tareas de seguridad (100% en ExploitBench) y contexto largo (100% en needle test hasta 512K tokens). Sin embargo, en el Intelligence Index de Artificial Analysis queda 5 puntos por debajo de Claude Fable 5.1 y también por detrás de Meta Muse Spark 1.3.
Resumen generado mediante IA a partir de Simon Willison (original en inglés). Naturaleza de la información: declaración de parte interesada.
Análisis Por qué importa
Es el nuevo modelo insignia de OpenAI para competir directamente con Anthropic en precio y capacidades, especialmente en tareas de seguridad y contexto largo, aunque no lidera en inteligencia general según benchmarks independientes.
- Quién se ve afectado
- Empresas que usan LLMs vía API para tareas de seguridad, código, o procesamiento de documentos extensos, y equipos de compras de IA que comparan proveedores.
- Qué puede cambiar
- Se reduce la brecha de precio-rendimiento entre OpenAI y Anthropic, y mejora sustancialmente el manejo de contextos muy largos, lo que puede facilitar casos de uso antes limitados por esta restricción.
Análisis generado a partir de la información disponible; no procede de la fuente.
Predicción Qué observar a continuación
Habrá que vigilar el acceso real y pruebas independientes de Simon Willison y otros analistas una vez el modelo esté disponible, así como si OpenAI publica resultados con el harness estándar de ARC-AGI para comparación justa con Fable.
Recomendación Qué debería hacer una empresa
Los equipos técnicos deberían evaluar Astra en pruebas piloto de seguridad ofensiva/defensiva y procesamiento de documentos largos en los próximos 1-3 meses antes de decidir migración desde otros proveedores.
Recomendación generada por IA con la evidencia disponible; no es asesoramiento profesional.
Fuente original: Simon Willison. La referencia es siempre el artículo original.
Ver fuente original ↗LLMcontexto largoagentesseguridad ARC-AGIbenchmarksClaude FableGPT-6 AstraOpenAI
Forma parte de la historia OpenAI lanza GPT-6 Astra: capacidad crítica y opacidad en ciberseguridad (17 noticias, estado: alto impacto).
Relacionadas
Sam Altman admite un lanzamiento 'caótico' de GPT-6 Astra por problemas de acceso escalonado
OpenAI lanzó GPT-6 Astra el 4 de septiembre, pero los suscriptores de pago de ChatGPT (Plus, Pro, Business, Enterprise) y desarrolladores de la API no pudieron…
Por qué importaEl caso muestra que el anuncio de un modelo no equivale a su disponibilidad real, lo que obliga a los CIO a verificar el nivel de acceso y gobernanza…
GPT-6 Astra de OpenAI reaviva el debate sobre si se alcanzó la IA general
OpenAI lanzó GPT-6 Astra, que muestra mejoras notables en tareas de agente, automatización y programación frente a GPT-5.6 Sol, según benchmarks como OSWorld…
Por qué importaMás allá de la etiqueta de AGI, Astra consolida la transición del chatbot al 'agente' capaz de ejecutar flujos de trabajo completos con mínima…
Demostraciones virales de GPT-6 Astra reavivan debate sobre AGI y opacidad de razonamiento
Usuarios muestran a GPT-6 Astra completando el juego Portal en unas 24 horas de forma autónoma y dibujando una figura reconocible en Google Calendar mediante…
Por qué importaLa reducción de la cadena de pensamiento visible dificulta la supervisión externa de modelos cada vez más autónomos, lo que preocupa a investigadores…
ARC Prize matiza el 99,9% de GPT-6 Astra en ARC-AGI-3: cae a 62,7% sin memoria persistente
OpenAI presentó a GPT-6 Astra con una puntuación de 99,9% en ARC-AGI-3. ARC Prize, la organización que verificó el resultado, precisó que esa cifra se logró…
Por qué importaMuestra que los benchmarks de IA dependen fuertemente del entorno y las herramientas de apoyo, no solo del modelo, lo que obliga a leer con cautela…



