Ir al contenido
IA para hoy
Modelos y avances Benchmark

Análisis informal compara calidad y coste de GPT-6 Astra frente a GPT-5.6 con test de pelícanos

Análisis informal compara calidad y coste de GPT-6 Astra frente a GPT-5.6 con test de pelícanos
Imagen: Simon Willison

Hecho Qué ha ocurrido

El desarrollador Simon Willison probó GPT-6 Astra generando SVGs de pelícanos en bicicleta en cinco niveles de razonamiento y los comparó con GPT-5.6 Sol, Terra y Luna. Astra cuesta el doble por token que Sol ($10/$50 por millón frente a $5/$30) pero consume menos tokens, y su nivel más bajo produce mejores resultados que cualquier nivel de Sol por unos 9,55 centavos. También observó que Astra y Luna usan el mismo número de tokens de entrada (16), distinto de Sol y Terra (26), lo que sugiere posible parentesco entre modelos.

Resumen generado mediante IA a partir de Simon Willison (original en inglés). Naturaleza de la información: análisis u opinión.

Análisis Por qué importa

Aunque es un test informal y no riguroso, ofrece una señal temprana comparativa de calidad-precio entre modelos recién lanzados de OpenAI, útil para quienes evalúan qué modelo usar en tareas generativas.

Quién se ve afectado
Desarrolladores y empresas que evalúan qué modelo de OpenAI usar para generación de contenido visual o tareas creativas.
Qué puede cambiar
Sugiere que Astra podría ofrecer mejor relación calidad-precio que Sol en tareas de generación, incluso en niveles de razonamiento bajos.

Análisis generado a partir de la información disponible; no procede de la fuente.

Predicción Qué observar a continuación

Si OpenAI confirma o niega relaciones arquitectónicas entre Astra y Luna, y si aparecen benchmarks más rigurosos que confirmen las diferencias de calidad observadas informalmente.

Compartir WhatsApp LinkedIn X Bluesky Telegram Correo

Fuente original: Simon Willison. La referencia es siempre el artículo original.

Ver fuente original ↗

LLMmultimodalgeneración de imágenes benchmark informalGPT-5.6GPT-6 AstraOpenAIpelican riding a bicycle

Relacionadas

Empresa y transformación digital 17 fuentes

Sam Altman admite un lanzamiento 'caótico' de GPT-6 Astra por problemas de acceso escalonado

OpenAI lanzó GPT-6 Astra el 4 de septiembre, pero los suscriptores de pago de ChatGPT (Plus, Pro, Business, Enterprise) y desarrolladores de la API no pudieron…

Por qué importaEl caso muestra que el anuncio de un modelo no equivale a su disponibilidad real, lo que obliga a los CIO a verificar el nivel de acceso y gobernanza…

Impacto medio Fiabilidad confirmado por varias fuentes Computerworld España
Modelos y avances 17 fuentes

GPT-6 Astra de OpenAI reaviva el debate sobre si se alcanzó la IA general

OpenAI lanzó GPT-6 Astra, que muestra mejoras notables en tareas de agente, automatización y programación frente a GPT-5.6 Sol, según benchmarks como OSWorld…

Por qué importaMás allá de la etiqueta de AGI, Astra consolida la transición del chatbot al 'agente' capaz de ejecutar flujos de trabajo completos con mínima…

Impacto alto Fiabilidad confirmado por varias fuentes Relevancia 8/10 Clarín Tecnología
Modelos y avances 17 fuentes

Demostraciones virales de GPT-6 Astra reavivan debate sobre AGI y opacidad de razonamiento

Usuarios muestran a GPT-6 Astra completando el juego Portal en unas 24 horas de forma autónoma y dibujando una figura reconocible en Google Calendar mediante…

Por qué importaLa reducción de la cadena de pensamiento visible dificulta la supervisión externa de modelos cada vez más autónomos, lo que preocupa a investigadores…

Impacto medio Fiabilidad confirmado por varias fuentes Xataka México
Modelos y avances 17 fuentes

ARC Prize matiza el 99,9% de GPT-6 Astra en ARC-AGI-3: cae a 62,7% sin memoria persistente

OpenAI presentó a GPT-6 Astra con una puntuación de 99,9% en ARC-AGI-3. ARC Prize, la organización que verificó el resultado, precisó que esa cifra se logró…

Por qué importaMuestra que los benchmarks de IA dependen fuertemente del entorno y las herramientas de apoyo, no solo del modelo, lo que obliga a leer con cautela…

Impacto alto Fiabilidad declaración interesada Relevancia 8/10 Infobae Tecno