Tecnología
evaluación de IA
Evolución en 16 semanas
El momentum semanal se estima con la misma fórmula que el momentum actual: volumen, aceleración respecto a la semana anterior, diversidad de fuentes e impacto.
Relacionadas
agentes ×2LLM ×1OpenAI ×1multimodal ×1Google DeepMind ×1Meta ×1AWS ×1Strands ×1benchmarking ×1Microsoft Research ×1
Historias
Noticias
AWS Strands Evals detecta automáticamente fallos de agentes IA y sus causas raíz
AWS ha publicado en su blog de Machine Learning una guía sobre los detectores del SDK Strands Evals, una herramienta que automatiza la identificación y…
Por qué importaReducir el tiempo de diagnóstico de fallos de agentes en producción de horas a minutos es crítico para equipos que operan agentes a escala. Las…
Microsoft presenta ADeLe, método para predecir y explicar el rendimiento de LLMs
Microsoft Research, en colaboración con Princeton University y Universitat Politècnica de València, ha publicado en Nature un método llamado ADeLe (AI…
Por qué importaADeLe resuelve un problema crítico en evaluación de IA: los benchmarks tradicionales reportan resultados en tareas específicas pero no explican por…
DeepMind presenta metodología estándar para evaluar agentes multimodales interactivos
DeepMind ha publicado un nuevo enfoque de evaluación llamado Standardised Test Suite (STS) para medir el desempeño de agentes de inteligencia artificial en…
Por qué importaEvaluar agentes interactivos es un problema crítico aún no resuelto: las métricas actuales no correlacionan bien con el rendimiento real en…


