Ir al contenido
IA para hoy
Investigación Benchmark

Benchmark RLI muestra que los mejores modelos de IA fallan en el 85% de encargos profesionales reales

Benchmark RLI muestra que los mejores modelos de IA fallan en el 85% de encargos profesionales reales
Foto: Tara Winstead · Licencia Pexels · Pexels

Hecho Qué ha ocurrido

El Remote Labor Index, desarrollado por Center for AI Safety y Scale Labs, mide la 'tasa de automatización' comparando entregas de IA con trabajos freelance reales evaluados por humanos. Su última actualización con GPT-5.5, Opus 4.8 y Fable 5 muestra que el mejor modelo, Fable 5, solo logra un 15,8% de éxito, frente al 8,3% de Opus 4.8 y 6,3% de GPT-5.5. Un 'juez automatizado' de IA sobreestimó estas tasas de éxito respecto a la evaluación humana real.

Resumen generado mediante IA a partir de Business Insider España. Naturaleza de la información: hecho documentado.

Análisis Por qué importa

Pese a la percepción de que los modelos avanzan rápido, siguen siendo poco fiables para trabajos profesionales completos y verificables, lo que contradice narrativas de sustitución laboral inminente.

Quién se ve afectado
Empresas que delegan trabajo profesional en IA sin supervisión: consultoras, despachos legales, diseño, arquitectura y desarrollo.
Qué puede cambiar
Refuerza la necesidad de supervisión humana rigurosa antes de aceptar entregables generados por IA, especialmente en contextos con consecuencias legales o profesionales.

Análisis generado a partir de la información disponible; no procede de la fuente.

Ilustración generada con IA sobre: Benchmark RLI muestra que los mejores modelos de IA fallan en el 85% de encargos profesionales reales
Ilustración generada con IA por IA para hoy

Predicción Qué observar a continuación

Si futuras versiones del RLI muestran mejoras sostenidas en la tasa de automatización y si las empresas empiezan a exigir verificación humana estandarizada de entregables de IA.

Recomendación Qué debería hacer una empresa

Las empresas que usan IA generativa para entregables profesionales deberían implementar revisión humana obligatoria antes de publicar o presentar cualquier documento en los próximos 3-6 meses.

Recomendación generada por IA con la evidencia disponible; no es asesoramiento profesional.

Compartir WhatsApp LinkedIn X Bluesky Telegram
Enviar esta noticia por correo

Se envía esta noticia con su análisis. La dirección se usa solo para ese envío y no se guarda.

Fuente original: Business Insider España. La referencia es siempre el artículo original.

Ver fuente original ↗

LLMbenchmarkagentes Center for AI SafetyScale LabsDeloitteKPMGEY alucinacionesbenchmark IAfiabilidad IARemote Labor Index

Tu opinión

0 comentarios

Sin registro. La primera vez te pediremos confirmar el correo y el comentario pasará por moderación; después se publican al momento si cumplen las normas. Se guarda un resumen de tu IP para evitar abusos.

Relacionadas

Investigación

NASA e IBM lanzan un modelo de IA de código abierto para analizar datos lunares

NASA e IBM han presentado el NASA-IBM Lunar Foundation Model, un modelo fundacional de código abierto entrenado con datos de misiones como LRO, GRAIL y…

Por qué importaAutomatiza tareas de análisis geológico que antes requerían revisión manual, acelerando la investigación científica previa a las misiones Artemis y a…

Impacto bajo Fiabilidad declaración interesada Hipertextual
Investigación

Google DeepMind lanza AlphaGenome Atlas, un mapa con IA de 9.000 millones de mutaciones del ADN humano

Google DeepMind presentó AlphaGenome Atlas, una base de datos que recopila predicciones sobre los efectos de los 9.000 millones de posibles cambios de una…

Por qué importaReduce drásticamente el trabajo de laboratorio necesario para explorar el efecto de variantes genéticas, acelerando la investigación biomédica y…

Impacto bajo Fiabilidad declaración interesada Relevancia 7/10 20minutos Tecnología
Investigación

Benchmark independiente sugiere gran salto de GPT-6 Astra en razonamiento espacial robótico

El nuevo benchmark StationeryBench comparó a GPT-6 Astra de OpenAI y MolmoAct2 de Ai2 en tareas de manipulación con robots de doble brazo YAM. Astra completó 7…

Por qué importaUn salto en razonamiento espacial de un modelo generalista tiene implicaciones directas para robótica industrial y automatización física, áreas donde…

Impacto bajo Fiabilidad declaración interesada The Decoder
Investigación

Estudio revela que los pasos de razonamiento escrito de modelos de IA se reflejan en patrones internos distintos

Investigadores de KAIST y Naver AI Lab identificaron ocho operaciones de razonamiento (extracción, descomposición, recuperación de fórmulas, deducción…

Por qué importaEl hallazgo sugiere que el 'chain of thought' visible no captura todo lo que ocurre internamente en un modelo, lo que refuerza la preocupación sobre…

Impacto bajo Fiabilidad declaración interesada The Decoder