GPT-6 Astra de OpenAI alcanza 80% de precisión detectando errores de montaje de muebles IKEA

Hecho Qué ha ocurrido
El benchmark FAB de Epoch AI evalúa modelos de IA para identificar errores en el montaje de muebles IKEA comparando fotos con instrucciones. GPT-6 Astra de OpenAI alcanzó 80% de precisión, frente al 28% del mejor modelo en noviembre de 2025 (Claude Opus 4.5). Claude Fable 5.1 logró 70% y Claude Opus 5, 61%; los modelos chinos de código abierto como Kimi K3 van al menos siete meses por detrás.
Resumen generado mediante IA a partir de The Decoder (original en inglés). Naturaleza de la información: hecho documentado.
Análisis Por qué importa
El avance muestra una mejora acelerada en razonamiento visual multimodal aplicado a tareas prácticas de verificación física, un tipo de capacidad con potencial en manuales técnicos, reparaciones y control de calidad.
- Quién se ve afectado
- Fabricantes de manuales técnicos, servicios de atención al cliente, empresas de reparación y mantenimiento, y desarrolladores de asistentes visuales.
- Qué puede cambiar
- Aunque aún es demasiado lento para asistencia en tiempo real (tres minutos por foto), sugiere que la asistencia visual paso a paso para ensamblaje o reparación podría volverse viable a medio plazo.
Análisis generado a partir de la información disponible; no procede de la fuente.
Predicción Qué observar a continuación
Vigilar la evolución de la velocidad de inferencia y si OpenAI u otros integran esta capacidad en productos de asistencia visual en tiempo real, así como nuevos benchmarks similares aplicados a otros dominios como reparación de electrodomésticos o vehículos.
Enviar esta noticia por correo
Fuente original: The Decoder. La referencia es siempre el artículo original.
Ver fuente original ↗multimodalLLMimagen OpenAIEpoch AIAnthropic benchmarkEpoch AIGPT-6 AstraOpenAIvisión por computadora
Tu opinión
0 comentarios
Relacionadas
Empresas chinas escalan modelos de IA hacia varios billones de parámetros pese a liderar los pequeños
Modelos chinos como Kimi K3 (2,8 billones de parámetros) y Qwen3.8-Max (2,4 billones) han escalado su tamaño total, aunque usan arquitecturas Mixture of…
Por qué importaMuestra que las grandes tecnológicas chinas compiten simultáneamente en eficiencia (modelos pequeños para dispositivos) y en escala masiva (modelos…
Google acelera el desarrollo de Gemini 4 y prevé lanzarlo antes de fin de 2026
Koray Kavukcuoglu, responsable de Google DeepMind, declaró a The Information que Gemini 4 ya está en fase de postentrenamiento y que Google busca lanzar una…
Por qué importaIndica que Google intensifica la competencia frente a OpenAI y Anthropic en modelos con capacidades agénticas y de programación, un área clave para…
El nuevo jefe de Google DeepMind adelanta que Gemini 4 llegará antes de fin de año
El nuevo responsable de Google DeepMind ha declarado que Gemini 4, el próximo modelo insignia de IA de Google, se lanzará antes de que termine 2026. Según…
Por qué importaUn lanzamiento más rápido de la próxima generación de Gemini intensifica la carrera competitiva con OpenAI y Anthropic, y puede acelerar la…
El jefe de DeepMind anticipa que Gemini 4 llegará antes de fin de 2026
Koray Kavukcuoglu, nuevo líder de DeepMind, dijo a The Information que Gemini 4 está en fase de postentrenamiento y se usa internamente en Antigravity, la…
Por qué importaGoogle necesita un salto de calidad claro para no quedar rezagado frente a los lanzamientos recientes de Claude Opus 5.5 y GPT-6 de OpenAI y…


