Artificial Analysis actualiza su Intelligence Index tras críticas por la puntuación de GPT-6 Astra

Hecho Qué ha ocurrido
Artificial Analysis lanzó la versión 4.2 de su Intelligence Index tras críticas de que sus benchmarks no reflejaban el progreso real de GPT-6 Astra. Con la actualización, Astra obtiene cuatro puntos más que su predecesor, aunque sigue por detrás de Claude Fable 5.1 de Anthropic, con Meta en tercer lugar. Se añadieron dos benchmarks nuevos (AA-Briefcase y GDP.pdf), se eliminó GPQA-Diamond por estar resuelto, y ahora un 40% de la ponderación proviene de datos de test privados para dificultar el 'gaming' del índice.
Resumen generado mediante IA a partir de The Decoder (original en inglés). Naturaleza de la información: hecho documentado.
Análisis Por qué importa
Los índices de benchmarking influyen en decisiones de compra y adopción de modelos por parte de empresas, por lo que su fiabilidad y metodología son relevantes para quienes evalúan proveedores de IA.
- Quién se ve afectado
- Empresas que evalúan modelos LLM para producción, equipos técnicos y analistas de mercado de IA.
- Qué puede cambiar
- Los rankings comparativos entre modelos frontera (OpenAI, Anthropic, Meta) se recalibran, lo que puede alterar decisiones de selección de proveedor basadas en benchmarks públicos.
Análisis generado a partir de la información disponible; no procede de la fuente.
Predicción Qué observar a continuación
Vigilar el despliegue en fases de la versión 5 del índice, prevista tras ocho meses de desarrollo, y si otras firmas de benchmarking ajustan sus metodologías de forma similar.
Fuente original: The Decoder. La referencia es siempre el artículo original.
Ver fuente original ↗LLMbenchmark Artificial AnalysisbenchmarksClaude Fable 5.1GPT-6 AstraIntelligence Index
Relacionadas
GPT-6 Astra completa Portal de principio a fin sin ayuda humana en 24 horas
El desarrollador cozyblaze publicó en X y GitHub un experimento en el que GPT-6 Astra jugó y completó el videojuego Portal de forma autónoma tras recibir un…
Por qué importaDemuestra capacidades de planificación y ejecución autónoma a largo plazo en entornos interactivos complejos, un paso hacia agentes generales capaces…
OpenAI lanza GPT-6 Astra con récord de benchmarks, salvaguardas de ciberseguridad y disculpa por rollout caótico
OpenAI lanzó el 3 de septiembre GPT-6 Astra, el primer modelo que cruza el umbral 'Critical' de ciberseguridad en su Preparedness Framework, con ExploitBench…
Por qué importaEs el primer modelo de frontera que documenta explícitamente capacidades ofensivas críticas junto a limitaciones de supervisión, lo que tensiona el…
OpenAI lanza GPT-6 Astra con capacidades críticas de riesgo, entre dudas sobre benchmarks reales
OpenAI presentó GPT-6 Astra, modelo clasificado en nivel de riesgo 'Crítico' por su capacidad de desarrollar exploits cibernéticos autónomamente, según su…
Por qué importaLa brecha entre las cifras que difunde OpenAI y las verificadas de forma independiente exige cautela al evaluar anuncios de capacidades…
OpenAI lanza GPT-6 Astra en medio de dudas sobre si ha logrado superinteligencia
OpenAI ha lanzado GPT-6 Astra, descrito como su modelo más potente hasta la fecha. La empresa, que prepara su salida a Bolsa, sugiere haber alcanzado…
Por qué importaUn nuevo modelo de referencia de OpenAI redefine el estado del arte y presiona a competidores y empresas a evaluar su adopción, mientras la narrativa…

