Ir al contenido
IA para hoy
Modelos y avances Benchmark

Artificial Analysis actualiza su Intelligence Index tras críticas por la puntuación de GPT-6 Astra

Imagen: The Decoder

Hecho Qué ha ocurrido

Artificial Analysis lanzó la versión 4.2 de su Intelligence Index tras críticas de que sus benchmarks no reflejaban el progreso real de GPT-6 Astra. Con la actualización, Astra obtiene cuatro puntos más que su predecesor, aunque sigue por detrás de Claude Fable 5.1 de Anthropic, con Meta en tercer lugar. Se añadieron dos benchmarks nuevos (AA-Briefcase y GDP.pdf), se eliminó GPQA-Diamond por estar resuelto, y ahora un 40% de la ponderación proviene de datos de test privados para dificultar el 'gaming' del índice.

Resumen generado mediante IA a partir de The Decoder (original en inglés). Naturaleza de la información: hecho documentado.

Análisis Por qué importa

Los índices de benchmarking influyen en decisiones de compra y adopción de modelos por parte de empresas, por lo que su fiabilidad y metodología son relevantes para quienes evalúan proveedores de IA.

Quién se ve afectado
Empresas que evalúan modelos LLM para producción, equipos técnicos y analistas de mercado de IA.
Qué puede cambiar
Los rankings comparativos entre modelos frontera (OpenAI, Anthropic, Meta) se recalibran, lo que puede alterar decisiones de selección de proveedor basadas en benchmarks públicos.

Análisis generado a partir de la información disponible; no procede de la fuente.

Predicción Qué observar a continuación

Vigilar el despliegue en fases de la versión 5 del índice, prevista tras ocho meses de desarrollo, y si otras firmas de benchmarking ajustan sus metodologías de forma similar.

Fuente original: The Decoder. La referencia es siempre el artículo original.

Ver fuente original ↗

LLMbenchmark Artificial AnalysisbenchmarksClaude Fable 5.1GPT-6 AstraIntelligence Index

Relacionadas

Modelos y avances 5 fuentes

GPT-6 Astra completa Portal de principio a fin sin ayuda humana en 24 horas

El desarrollador cozyblaze publicó en X y GitHub un experimento en el que GPT-6 Astra jugó y completó el videojuego Portal de forma autónoma tras recibir un…

Por qué importaDemuestra capacidades de planificación y ejecución autónoma a largo plazo en entornos interactivos complejos, un paso hacia agentes generales capaces…

Impacto bajo Fiabilidad confirmado por varias fuentes The Decoder
Modelos y avances 5 fuentes

OpenAI lanza GPT-6 Astra con récord de benchmarks, salvaguardas de ciberseguridad y disculpa por rollout caótico

OpenAI lanzó el 3 de septiembre GPT-6 Astra, el primer modelo que cruza el umbral 'Critical' de ciberseguridad en su Preparedness Framework, con ExploitBench…

Por qué importaEs el primer modelo de frontera que documenta explícitamente capacidades ofensivas críticas junto a limitaciones de supervisión, lo que tensiona el…

Impacto muy alto Fiabilidad confirmado por varias fuentes WWWhat's new
Modelos y avances 2 fuentes

OpenAI lanza GPT-6 Astra con capacidades críticas de riesgo, entre dudas sobre benchmarks reales

OpenAI presentó GPT-6 Astra, modelo clasificado en nivel de riesgo 'Crítico' por su capacidad de desarrollar exploits cibernéticos autónomamente, según su…

Por qué importaLa brecha entre las cifras que difunde OpenAI y las verificadas de forma independiente exige cautela al evaluar anuncios de capacidades…

Impacto alto Fiabilidad varias fuentes ABC Tecnología
Modelos y avances 8 fuentes

OpenAI lanza GPT-6 Astra en medio de dudas sobre si ha logrado superinteligencia

OpenAI ha lanzado GPT-6 Astra, descrito como su modelo más potente hasta la fecha. La empresa, que prepara su salida a Bolsa, sugiere haber alcanzado…

Por qué importaUn nuevo modelo de referencia de OpenAI redefine el estado del arte y presiona a competidores y empresas a evaluar su adopción, mientras la narrativa…

Impacto alto Fiabilidad confirmado por varias fuentes El País Tecnología