AWS publica benchmark que mide coste por respuesta correcta, no solo precio por token, en modelos OpenAI en Bedrock

Hecho Qué ha ocurrido
AWS publicó un harness de benchmarking de código abierto que compara modelos OpenAI (gpt-5.6-luna, gpt-5.6-terra, gpt-5.6-sol) disponibles en Amazon Bedrock frente a gpt-5.4-mini y gpt-5.4-nano de la API de OpenAI. El estudio mide coste por respuesta correcta en AIME, GPQA Diamond y MMLU-Pro, coste por trayectoria de agente en tareas de investigación web (DeepSearchQA), y calidad de entregables profesionales evaluados con rúbricas (GDPval). Tras una reducción de precios el 30 de julio de 2026, luna registró un coste por respuesta correcta de 0.0021 dólares en AIME frente a 0.0139 de mini, y en tareas de agente terra costó 0.31 dólares por respuesta correcta frente a 0.40 de mini.
Resumen generado mediante IA a partir de AWS Machine Learning Blog (original en inglés). Naturaleza de la información: declaración de parte interesada.
Análisis Por qué importa
Muestra que comparar modelos solo por precio por token puede llevar a decisiones equivocadas, ya que el número de reintentos, turnos de conversación y calidad final determinan el coste real por resultado útil. Es relevante para equipos técnicos que eligen modelos para producción en la nube.
- Quién se ve afectado
- Equipos de ingeniería, arquitectos de soluciones cloud y empresas que despliegan agentes de IA o aplicaciones basadas en LLM en producción.
- Qué puede cambiar
- Introduce una metodología reproducible para evaluar coste-eficiencia real de modelos en escenarios de agentes y tareas complejas, más allá del precio nominal por token.
Análisis generado a partir de la información disponible; no procede de la fuente.
Predicción Qué observar a continuación
Vigilar si otros proveedores adoptan métricas similares de 'coste por resultado', y si Amazon Bedrock ajusta precios de otros modelos tras esta comparación.
Recomendación Qué debería hacer una empresa
Los equipos que usan modelos en producción deberían ejecutar este harness open source sobre sus propias tareas antes de elegir modelo, en los próximos 3-6 meses.
Recomendación generada por IA con la evidencia disponible; no es asesoramiento profesional.
Enviar esta noticia por correo
Fuente original: AWS Machine Learning Blog (fuente primaria). La referencia es siempre el artículo original.
Ver fuente original ↗LLMagentesbenchmarking Amazon Web ServicesOpenAI agentes IAAmazon Bedrockbenchmarkcoste por tokenOpenAI
Tu opinión
0 comentarios
Relacionadas
AWS presenta arquitectura de monitorización dual para agentes de IA en producción
AWS publicó un artículo técnico sobre cómo monitorizar sistemas multiagente en producción combinando Amazon Bedrock AgentCore Evaluations (evaluación continua…
Por qué importaAborda un problema real de las empresas que despliegan agentes de IA: los fallos de calidad o de enrutamiento no siempre generan errores visibles en…
AWS explica cómo construir apps MCP con widgets interactivos en Amazon Bedrock AgentCore
AWS publicó un tutorial técnico que muestra cómo construir y desplegar una MCP App con widgets HTML interactivos usando Amazon Bedrock AgentCore. El sistema…
Por qué importaPermite a las empresas construir una única integración que funcione en múltiples asistentes de IA sin depender de un proveedor específico, reduciendo…
Anthropic detalla las salvaguardas que aplica al código generado por Claude
Boris Cherny, de Anthropic, afirma que el código de producción escrito por Claude debe superar un estándar más alto que el escrito por humanos. Según Cherny…
Por qué importaIlustra cómo una empresa que produce herramientas de codificación con IA gestiona internamente el riesgo de calidad y mantenibilidad del código…
OpenAI lanza ChatGPT para Servicios Financieros con Morgan Stanley y Evercore
OpenAI presentó ChatGPT para Servicios Financieros, desarrollado con Morgan Stanley y Evercore, que combina GPT-6 Astra con datos de proveedores como Daloopa…
Por qué importaEs un movimiento claro de OpenAI hacia la verticalización de productos empresariales, apuntando a un sector de alto valor donde la precisión y…



