Ir al contenido
IA para hoy

Lo esencial del día

Claude Sonnet 5 llega a Bedrock mientras la fiabilidad de los agentes queda en duda

30 de junio de 2026, 14:00

La jornada combina lanzamientos de peso en modelos y generación multimedia con un recordatorio incómodo: los agentes y navegadores con IA siguen siendo frágiles. Entre el anuncio de Claude Sonnet 5 en AWS, los nuevos modelos de Google DeepMind y varios trabajos de investigación sobre evaluación y optimización, el hilo común es pasar de la promesa a la producción con garantías.

Claude Sonnet 5, capacidades de Opus a precio de Sonnet en AWS

Fotografía de archivo que ilustra: Claude Sonnet 5 disponible en Amazon Bedrock con capacidades de agentes y codificación
Foto: Zayed Hossain · Licencia Pexels · Pexels

AWS incorpora Claude Sonnet 5 a Amazon Bedrock y Claude Platform, con mejoras en codificación, agentes y razonamiento, y precios promocionales hasta el 31 de agosto de 2026. Permite desplegar agentes complejos a escala sin cambiar de infraestructura ni recurrir a modelos más caros.

SkillOpt: mejorar agentes sin tocar los pesos del modelo

Fotografía de archivo que ilustra: Microsoft Research presenta SkillOpt, método para optimizar instrucciones de agentes sin cambiar pesos
Foto: RDNE Stock project · Licencia Pexels · Pexels

Microsoft Research trata las instrucciones de los agentes como parámetros entrenables externos y logra el mejor resultado o empate en las 52 celdas de evaluación, con una mejora de 58,8 a 82,3 puntos usando GPT-5.5. Para los equipos de producto es una vía barata y auditable de adaptar agentes a nuevos dominios.

Google DeepMind abarata la generación de imagen y vídeo

Fotografía de archivo que ilustra: Google DeepMind lanza Nano Banana 2 Lite y Gemini Omni Flash para generación de imagen y vídeo
Foto: Jonathan Borba · Licencia Pexels · Pexels

Nano Banana 2 Lite apunta a imágenes rápidas y económicas, y Gemini Omni Flash entra en vista previa pública para vídeo a 0,10 dólares por segundo generado. Baja la barrera económica para integrar contenido multimedia en aplicaciones de comercio electrónico, diseño y marketing.

Los navegadores con IA pueden ser desarmados por una web maliciosa

Fotografía de archivo que ilustra: Navegadores con IA vulnerable a ataques que desactivan sus controles de seguridad
Foto: iram shehzad · Licencia Pexels · Pexels

Investigadores muestran que un sitio puede inducir al navegador a una 'realidad alternativa' donde sus controles dejan de aplicarse, con acceso a repositorios privados o credenciales guardadas. Confirma que los guardarraíles basados en reglas son eludibles y obliga a cautela antes de adoptarlos en entornos corporativos.

ScarfBench destapa la brecha entre código generado y código que funciona

Fotografía de archivo que ilustra: IBM Research lanza ScarfBench para evaluar agentes de IA en migraciones de frameworks Java
Foto: Zayed Hossain · Licencia Pexels · Pexels

El nuevo benchmark de IBM Research para migraciones de frameworks Java revela que agentes punteros declaran un 97% de éxito en compilación cuando solo el 73% compila realmente. Es un dato clave para decidir cuánto delegar en agentes en proyectos de modernización en producción.

Hugging Face unifica 229.000 resultados de evaluación

Fotografía de archivo que ilustra: Every Eval Ever y Community Evals: unificación de evaluaciones de modelos de IA
Foto: fauxels · Licencia Pexels · Pexels

La integración de Community Evals con Every Eval Ever centraliza evaluaciones de 22.000 modelos y 2.200 benchmarks procedentes de 31 formatos distintos. Reduce la fragmentación que hoy hace que un mismo modelo obtenga puntuaciones muy dispares en la misma prueba.

Conviene vigilar la distancia entre lo que los agentes prometen en las demostraciones y lo que resisten en producción: la evaluación rigurosa y la seguridad del contexto son ya el cuello de botella real.

Días anteriores

Ver todo el archivo de resúmenes