Ir al contenido
IA para hoy
Investigación Benchmark

Nuevo benchmark revela que los modelos IA aún no están listos para reemplazar trabajo de oficina

Hecho Qué ha ocurrido

Mercor, plataforma de datos de entrenamiento, ha publicado APEX-Agents, un benchmark que evalúa a los principales modelos IA en tareas reales de trabajo profesional (consultoría, banca de inversión, derecho). Los resultados muestran que todos los modelos fracasan: el mejor desempeño es Gemini 3 Flash con apenas 24% de precisión, seguido por GPT-5.2 con 23%, mientras que la mayoría obtiene alrededor del 18%. El principal obstáculo identificado es la dificultad de los modelos para rastrear información en múltiples dominios, algo fundamental en el trabajo profesional real.

Resumen generado mediante IA a partir de TechCrunch AI (original en inglés). Naturaleza de la información: hecho documentado.

Análisis Por qué importa

Contradice la predicción de Satya Nadella (hace dos años) de que la IA reemplazaría rápidamente el trabajo de conocimiento. El benchmark evidencia una brecha significativa entre las capacidades actuales de los modelos y lo que se requiere para automatizar profesiones de alto valor, lo que afecta tanto a expectativas empresariales como a planes de inversión en IA.

Quién se ve afectado
Profesionales de derecho, banca de inversión y consultoría; empresas que esperan automatizar trabajo de oficina mediante agentes IA; laboratorios de IA compitiendo por demostrar capacidades empresariales.
Qué puede cambiar
Si se confirma este patrón, las empresas deberán revisar a la baja sus expectativas sobre automatización de trabajo profesional a corto plazo y replanificar inversiones en agentes IA. El énfasis se desplazará de reemplazo de trabajadores a asistencia y aumento de productividad.

Análisis generado a partir de la información disponible; no procede de la fuente.

Predicción Qué observar a continuación

Mejora de tasas de precisión en próximos lanzamientos de modelos (Foody señala que la mejora ha sido rápida año a año); adopción de arquitecturas multiagente para rastrear información distribuida; lanzamiento de benchmarks similares por competidores como OpenAI; evolución de productos IA empresariales hacia modelos de asistencia en lugar de automatización completa.

Recomendación Qué debería hacer una empresa

Las empresas deben evaluar en los próximos 6-12 meses si los agentes IA con acceso a múltiples fuentes de información (Slack, Drive, etc.) mejoran su precisión en tareas reales antes de comprometer presupuestos significativos en automatización de trabajo profesional.

Recomendación generada por IA con la evidencia disponible; no es asesoramiento profesional.

Compartir WhatsApp LinkedIn X Bluesky Telegram
Enviar esta noticia por correo

Se envía esta noticia con su análisis. La dirección se usa solo para ese envío y no se guarda.

Fuente original: TechCrunch AI. La referencia es siempre el artículo original.

Ver fuente original ↗

agentesLLMmultimodal MercorOpenAIGoogle DeepMindAnthropic agentes IAautomatizaciónbenchmarkstrabajo profesional

Fuentes de esta historia

Esta noticia forma parte de una historia cubierta por 3 publicaciones. La fiabilidad sube cuando varias fuentes independientes la confirman.

  1. TechCrunch AI estás leyendo esta
    · confirmado por varias fuentes · artículo original ↗
  2. Simon Willison
    · confirmado por varias fuentes · artículo original ↗
  3. Wired AI
    · una fuente fiable · artículo original ↗

Ver la historia completa con su línea temporal →

Tu opinión

0 comentarios

Sin registro. La primera vez te pediremos confirmar el correo y el comentario pasará por moderación; después se publican al momento si cumplen las normas. Se guarda un resumen de tu IP para evitar abusos.

Relacionadas

Modelos y avances 3 fuentes

Investigadores cuestionan viabilidad matemática de agentes IA autónomos complejos

Un paper reciente de Vishal Sikka (exCTO de SAP) y su hijo argumenta que los modelos de lenguaje tienen limitaciones matemáticas inherentes que los incapacitan…

Por qué importaLas limitaciones en fiabilidad de los agentes IA definirán su adopción corporativa real en los próximos años. Las empresas necesitan entender si…

Impacto alto Fiabilidad una fuente fiable Relevancia 7/10 Wired AI
Investigación 3 fuentes

Vogel simula formación de estados con agentes IA y Claude con asignación de tokens

Theia Vogel, desarrollador citado por Simon Willison, describe un experimento de simulación donde múltiples instancias de Claude (asignadas como alcaldes)…

Por qué importaDemuestra un caso práctico de coordinación multiagente y competencia entre modelos IA con restricciones de recursos, relevante para entender cómo…

Impacto bajo Fiabilidad confirmado por varias fuentes Simon Willison
Investigación

DeepMind lanza AlphaGenome Atlas con predicciones de 9.000 millones de variantes del genoma humano

Google DeepMind ha publicado el AlphaGenome Atlas, un conjunto de datos de un petabyte que predice el efecto molecular de cada una de las aproximadamente nueve…

Por qué importaEsta base de datos podría acelerar drásticamente el diagnóstico de enfermedades raras y la investigación genética al reducir el tiempo necesario para…

Impacto medio Fiabilidad declaración interesada Relevancia 8/10 The Decoder
Investigación 11 fuentes

Debate sobre el papel de la IA de OpenAI en la solución del problema de Navier-Stokes

OpenAI afirmó que su IA ayudó a resolver aspectos del problema matemático de Navier-Stokes, uno de los enigmas abiertos de la matemática desde hace casi 200…

Por qué importaEl caso ilustra la disputa creciente sobre atribución y verificación de resultados científicos cuando intervienen sistemas de IA, algo relevante para…

Impacto bajo Fiabilidad confirmado por varias fuentes El Tiempo Tecnósfera