Benchmark RLI muestra que los mejores modelos de IA fallan en el 85% de encargos profesionales reales

Hecho Qué ha ocurrido
El Remote Labor Index, desarrollado por Center for AI Safety y Scale Labs, mide la 'tasa de automatización' comparando entregas de IA con trabajos freelance reales evaluados por humanos. Su última actualización con GPT-5.5, Opus 4.8 y Fable 5 muestra que el mejor modelo, Fable 5, solo logra un 15,8% de éxito, frente al 8,3% de Opus 4.8 y 6,3% de GPT-5.5. Un 'juez automatizado' de IA sobreestimó estas tasas de éxito respecto a la evaluación humana real.
Resumen generado mediante IA a partir de Business Insider España. Naturaleza de la información: hecho documentado.
Análisis Por qué importa
Pese a la percepción de que los modelos avanzan rápido, siguen siendo poco fiables para trabajos profesionales completos y verificables, lo que contradice narrativas de sustitución laboral inminente.
- Quién se ve afectado
- Empresas que delegan trabajo profesional en IA sin supervisión: consultoras, despachos legales, diseño, arquitectura y desarrollo.
- Qué puede cambiar
- Refuerza la necesidad de supervisión humana rigurosa antes de aceptar entregables generados por IA, especialmente en contextos con consecuencias legales o profesionales.
Análisis generado a partir de la información disponible; no procede de la fuente.
Predicción Qué observar a continuación
Si futuras versiones del RLI muestran mejoras sostenidas en la tasa de automatización y si las empresas empiezan a exigir verificación humana estandarizada de entregables de IA.
Recomendación Qué debería hacer una empresa
Las empresas que usan IA generativa para entregables profesionales deberían implementar revisión humana obligatoria antes de publicar o presentar cualquier documento en los próximos 3-6 meses.
Recomendación generada por IA con la evidencia disponible; no es asesoramiento profesional.
Enviar esta noticia por correo
Fuente original: Business Insider España. La referencia es siempre el artículo original.
Ver fuente original ↗LLMbenchmarkagentes Center for AI SafetyScale LabsDeloitteKPMGEY alucinacionesbenchmark IAfiabilidad IARemote Labor Index
Tu opinión
0 comentarios
Relacionadas
NASA e IBM lanzan un modelo de IA de código abierto para analizar datos lunares
NASA e IBM han presentado el NASA-IBM Lunar Foundation Model, un modelo fundacional de código abierto entrenado con datos de misiones como LRO, GRAIL y…
Por qué importaAutomatiza tareas de análisis geológico que antes requerían revisión manual, acelerando la investigación científica previa a las misiones Artemis y a…
Google DeepMind lanza AlphaGenome Atlas, un mapa con IA de 9.000 millones de mutaciones del ADN humano
Google DeepMind presentó AlphaGenome Atlas, una base de datos que recopila predicciones sobre los efectos de los 9.000 millones de posibles cambios de una…
Por qué importaReduce drásticamente el trabajo de laboratorio necesario para explorar el efecto de variantes genéticas, acelerando la investigación biomédica y…
Benchmark independiente sugiere gran salto de GPT-6 Astra en razonamiento espacial robótico
El nuevo benchmark StationeryBench comparó a GPT-6 Astra de OpenAI y MolmoAct2 de Ai2 en tareas de manipulación con robots de doble brazo YAM. Astra completó 7…
Por qué importaUn salto en razonamiento espacial de un modelo generalista tiene implicaciones directas para robótica industrial y automatización física, áreas donde…
Estudio revela que los pasos de razonamiento escrito de modelos de IA se reflejan en patrones internos distintos
Investigadores de KAIST y Naver AI Lab identificaron ocho operaciones de razonamiento (extracción, descomposición, recuperación de fórmulas, deducción…
Por qué importaEl hallazgo sugiere que el 'chain of thought' visible no captura todo lo que ocurre internamente en un modelo, lo que refuerza la preocupación sobre…



