DeepMind presenta metodología estándar para evaluar agentes multimodales interactivos
DeepMind ha publicado un nuevo enfoque de evaluación llamado Standardised Test Suite (STS) para medir el desempeño de agentes de inteligencia artificial en…
Por qué importaEvaluar agentes interactivos es un problema crítico aún no resuelto: las métricas actuales no correlacionan bien con el rendimiento real en…
Impacto medio
Fiabilidad fuente primaria
Google DeepMind