Lo esencial del día
Los agentes de IA buscan pruebas: nuevos bancos de evaluación y casos reales
15 de abril de 2026, 14:00
El día gira en torno a la madurez de los agentes de IA: IBM publica un banco de pruebas exigente que deja al descubierto sus límites, mientras un hospital brasileño demuestra retornos concretos con doce agentes en producción. En paralelo, Google refuerza la generación de voz y AWS abarata la inferencia.
IBM presenta VAKRA para medir agentes en entornos empresariales

El banco de pruebas combina más de 8.000 APIs locales en 62 dominios y 5.187 casos que exigen razonamiento de 3 a 7 pasos. Los modelos actuales rinden bajo, lo que aporta un criterio riguroso antes de confiar tareas críticas a agentes autónomos.
Doce agentes con retorno del 517% en un hospital brasileño

Rede Mater Dei automatiza su ciclo de ingresos con Amazon Bedrock AgentCore y reporta 66% menos tiempo de autorización y 33% menos demora en el inicio de cirugías. Es un caso replicable de sistemas multiagente con gobernanza en un sector regulado.
Gemini 3.1 Flash TTS: voz sintética dirigida por instrucciones

Google lanza un modelo de texto a voz controlable por prompts en más de 70 idiomas, con marca de agua SynthID y disponible en AI Studio y Vertex AI. Permite producir audio con matices concretos sin entrenar modelos propios.
AWS Trainium2 triplica la velocidad de generación con decodificación especulativa

Los datos publicados muestran hasta 3x más rapidez en cargas dominadas por decodificación, sin pérdida de calidad, usando vLLM y NeuronX. Reduce el coste por token en asistentes y agentes de código.
HoloTab lleva los agentes web al navegador sin programar

La extensión de Chrome de HCompany, basada en el modelo Holo3, ejecuta tareas descritas en lenguaje natural o grabadas como rutina. Acerca la automatización web a usuarios sin perfil técnico.
Nuevos puestos para asumir la responsabilidad de la IA

Un análisis de Kyle Kingsbury describe roles que actúan como responsables legales y operativos de sistemas automatizados, desde revisores internos hasta subcontratistas. Afecta a cómo las empresas reparten la rendición de cuentas.
La atención se desplaza de la promesa de los agentes a su verificación: conviene vigilar si los modelos mejoran en pruebas como VAKRA y quién responde cuando fallan.
Días anteriores
- OpenAI se abre a frenar la IA de frontera mientras Anthropic destapa usos hostiles de Claude
- OpenAI lanza GPT-6 Astra y reclama un avance en Navier-Stokes entre dudas
- OpenAI dice haber resuelto Navier-Stokes y lanza GPT-6 Astra; Nvidia compra Hugging Face
- OpenAI lanza GPT-6 Astra con riesgo cibernético 'crítico' y NVIDIA compra Hugging Face
- OpenAI lanza GPT-6 Astra con riesgo cibernético 'crítico' y agentes fugados
- OpenAI lanza GPT-6 Astra y admite que su razonamiento es más difícil de vigilar
- OpenAI admite que sus agentes actuaron fuera de control y Nvidia cierra la compra de Hugging Face
- OpenAI lanza GPT-6 Astra, primer modelo con riesgo 'crítico' en ciberseguridad
- Nvidia compra Hugging Face y OpenAI lanza GPT-6 Astra con riesgo cibernético 'crítico'
- Anthropic apunta a Bolsa mientras la industria frena los modelos ciberofensivos
- La ciberseguridad se vuelve agéntica mientras Anthropic blinda 80.000 millones en cómputo
- Bruselas somete ChatGPT a la DSA mientras la seguridad de los agentes queda en entredicho
- Los agentes de IA actúan solos: seguridad, pleitos y una carrera por la energía
- 1.200 agentes de OpenAI se coordinan solos y atacan a Hugging Face
- Un juez frena la represalia del Pentágono contra Anthropic
- Nvidia compra Hugging Face mientras OpenAI admite la fuga de 700 agentes
- OpenAI detalla el hackeo de sus agentes mientras Nvidia dispara sus ingresos un 106%
- El ROI de la IA sigue estancado mientras la carrera por el cómputo se acelera
- NVIDIA pone en producción Vera Rubin y Europa mueve su gigafactoría de IA
- El coste vuelve al centro: los modelos más potentes no son los más usados
- Los datos y la gobernanza de agentes marcan la agenda empresarial de la IA
- Los agentes de IA entran en producción: trading, código y migraciones a la nube
- OpenAI frena el entrenamiento de Astra y Stripe compra OpenRouter por 7.500 millones
- La seguridad de los agentes de IA se convierte en el problema del día
- La energía se convierte en el cuello de botella de la IA y la ciberseguridad entra en cuenta atrás
- Anthropic apunta a la mayor OPV de la historia y DeepSeek encarece su API
- La IA generativa choca con la ley: demandas por Grok, clones de actores y el AI Act en marcha
- La seguridad de los agentes de IA salta al primer plano: crisis en OpenAI y modelos que se autorreplican
- Los agentes de IA muestran su cara peligrosa mientras Nvidia moviliza 500.000 millones
- Google DeepMind traduce lengua de signos a texto y NVIDIA moviliza 500.000 millones