Nuevas herramientas para evaluar el rendimiento real de modelos de IA
Resumen En qué punto está
AWS y Hugging Face han lanzado en los últimos días sistemas para evaluar de forma más fiable el desempeño de los modelos de lenguaje. AWS integró Amazon Nova LLM-as-a-Judge en SageMaker, un juez automático entrenado con datos humanos en más de 90 idiomas. Hugging Face, por su parte, presentó Community Evals, una plataforma descentralizada donde la comunidad reporta resultados verificables usando benchmarks estandarizados como MMLU-Pro, GPQA y HLE. Ambas iniciativas responden a un mismo problema: los benchmarks tradicionales están saturados y no reflejan el rendimiento real de los modelos en tareas prácticas.
Resumen generado mediante IA a partir de las 2 noticias de la historia. Última actualización: hace 13 min.
Enviar esta historia por correo
Línea temporal
-
Hugging Face descentraliza evaluaciones de modelos con resultados verificables de la comunidad
Hugging Face ha lanzado Community Evals, una plataforma que permite a cualquier usuario reportar resultados de evaluación de modelos de IA de forma descentralizada y verificable. Los repositorios de datasets ahora…
-
AWS lanza Amazon Nova LLM-as-a-Judge para evaluar modelos IA en SageMaker
AWS ha introducido Amazon Nova LLM-as-a-Judge, una capacidad integrada en SageMaker AI para evaluar el rendimiento de modelos de lenguaje de forma automática mediante comparación de pares. El modelo ha sido entrenado…