Un benchmark que evalúa la IA verificando montajes de muebles de Ikea sube de 28% a 80% en diez meses

Hecho Qué ha ocurrido
Epoch AI creó el Furniture Assembly Benchmark (FAB), que pide a modelos de IA verificar si muebles de IKEA fueron montados correctamente usando fotos y el manual oficial. En noviembre de 2025 el mejor modelo, Claude 4.5, acertaba un 28%; en septiembre de 2026 GPT-6 Astra alcanzó un 80% y redujo el tiempo por foto a unos tres minutos. El test también reveló sesgos distintos entre familias de modelos: Gemini y Qwen tienden a inventar errores inexistentes, mientras modelos anteriores de OpenAI y Anthropic pasaban por alto fallos reales.
Resumen generado mediante IA a partir de Xataka. Naturaleza de la información: hecho documentado.
Análisis Por qué importa
El benchmark mide razonamiento abstracto y visión aplicada a instrucciones del mundo real, una capacidad clave para que la IA asista en tareas técnicas de verificación e inspección, aunque aún no implica capacidad física de ejecución.
- Quién se ve afectado
- Equipos de investigación en IA, empresas de robótica, fabricantes que evalúan uso de IA para control de calidad o inspección visual.
- Qué puede cambiar
- El progreso sugiere que modelos multimodales están mejorando en tareas de verificación visual compleja combinando texto e imagen, lo que podría anticipar aplicaciones en control de calidad industrial o soporte técnico documentado.
Análisis generado a partir de la información disponible; no procede de la fuente.
Predicción Qué observar a continuación
Vigilar si nuevos benchmarks similares surgen para tareas de verificación en otros dominios (electrónica, automoción) y si los sesgos de falsos positivos/negativos se corrigen en próximas generaciones de modelos.
Enviar esta noticia por correo
Fuente original: Xataka. La referencia es siempre el artículo original.
Ver fuente original ↗multimodalvisiónrazonamiento Epoch AIOpenAIAnthropicGoogleIKEA benchmarkEpoch AIGPT-6IKEArazonamiento visual
Tu opinión
0 comentarios
Relacionadas
Import AI analiza filosofía de mentes platónicas y falta de algoritmo universal en robótica
El boletín Import AI de Jack Clark recoge un paper de Michael Levin sobre 'mentes platónicas' aplicado a biología sintética e IA, y un ensayo de investigadores…
Por qué importaSugiere que el 'momento LLM' de la robótica requiere converger en prácticas estándar de post-entrenamiento (definición de éxito, reinicio de escena…
IA generativa avanza en autonomía de naves y robots espaciales, con NASA e Icarus Robotics a la cabeza
NASA usó modelos Claude de Anthropic para planificar rutas del róver Perseverance en Marte con supervisión humana; en mayo NASA e IBM probaron un modelo de IA…
Por qué importaIlustra un cambio de paradigma en ingeniería aeroespacial, donde sistemas no deterministas empiezan a complementar el control humano estricto…
OpenAI resuelve con IA un problema matemático abierto y desata debate sobre comprensión frente a fuerza bruta
OpenAI afirma haber resuelto, usando miles de agentes de IA, el problema de existencia y suavidad de Navier-Stokes, un enigma matemático de décadas. La prueba…
Por qué importaEl caso ilustra tensiones sobre transparencia, atribución y comprensión cuando la IA acelera investigación científica sin explicar su razonamiento…
Startup británica Worldmodeldata convierte datos de videojuegos en entrenamiento para modelos de mundo
Worldmodeldata, startup británica asesorada por Yann LeCun, licencia inputs de controladores y datos visuales de estudios de videojuegos para crear datasets…
Por qué importaLa escasez de datos de causa-efecto físico es uno de los mayores cuellos de botella para avanzar en robótica y vehículos autónomos, y esta propuesta…



