Ir al contenido
IA para hoy

Tecnología

evaluación de IA

Evolución en 16 semanas

Noticias por semana y momentum estimado por semana 1 6,3 1 12,5 27/05 17/06: 1 17/06 08/07 29/07 19/08 09/09 27/05: 003/06: 010/06: 017/06: 12,524/06: 001/07: 008/07: 015/07: 022/07: 029/07: 005/08: 012/08: 019/08: 026/08: 002/09: 009/09: 0
Noticias por semana Momentum estimado · Fuentes distintas en la última semana: 0

El momentum semanal se estima con la misma fórmula que el momentum actual: volumen, aceleración respecto a la semana anterior, diversidad de fuentes e impacto.

Relacionadas

agentes ×2LLM ×1OpenAI ×1multimodal ×1Google DeepMind ×1Meta ×1AWS ×1Strands ×1benchmarking ×1Microsoft Research ×1

Historias

Noticias

AWS Strands Evals detecta automáticamente fallos de agentes IA y sus causas raíz

AWS ha publicado en su blog de Machine Learning una guía sobre los detectores del SDK Strands Evals, una herramienta que automatiza la identificación y…

Por qué importaReducir el tiempo de diagnóstico de fallos de agentes en producción de horas a minutos es crítico para equipos que operan agentes a escala. Las…

Impacto medio Fiabilidad fuente primaria Relevancia 7/10 AWS Machine Learning Blog
Investigación 2 fuentes

Microsoft presenta ADeLe, método para predecir y explicar el rendimiento de LLMs

Microsoft Research, en colaboración con Princeton University y Universitat Politècnica de València, ha publicado en Nature un método llamado ADeLe (AI…

Por qué importaADeLe resuelve un problema crítico en evaluación de IA: los benchmarks tradicionales reportan resultados en tareas específicas pero no explican por…

Impacto alto Fiabilidad confirmado por varias fuentes Relevancia 8/10 Microsoft Research
Investigación

DeepMind presenta metodología estándar para evaluar agentes multimodales interactivos

DeepMind ha publicado un nuevo enfoque de evaluación llamado Standardised Test Suite (STS) para medir el desempeño de agentes de inteligencia artificial en…

Por qué importaEvaluar agentes interactivos es un problema crítico aún no resuelto: las métricas actuales no correlacionan bien con el rendimiento real en…

Impacto medio Fiabilidad fuente primaria Relevancia 7/10 Google DeepMind