Ir al contenido
IA para hoy
Estable 1 noticias · 1 fuentesdel 1 sep al 1 sep

BenchMIRT revela qué miden realmente los benchmarks LLM

Línea temporal

  1. Hugging FaceFiabilidad fuente primaria

    BenchMIRT: método para auditar qué miden realmente los benchmarks de modelos

    Allen Institute for AI ha presentado BenchMIRT, una metodología que aplica teoría de respuesta a items multidimensional (MIRT) para analizar benchmarks de modelos de lenguaje a nivel de preguntas individuales. El método…