Ir al contenido
IA para hoy

Tecnología

evaluación

Relacionadas

LLM ×5Hugging Face ×2OpenAI ×2benchmark ×2seguridad ×2multimodal ×1benchmarking ×1Google DeepMind ×1AI2 ×1Kaggle ×1

Historias

Noticias

BenchMIRT: método para auditar qué miden realmente los benchmarks de modelos

Allen Institute for AI ha presentado BenchMIRT, una metodología que aplica teoría de respuesta a items multidimensional (MIRT) para analizar benchmarks de…

Por qué importaPara equipos de investigación y empresas que evalúan modelos, comprender qué mide realmente cada benchmark es crítico para elegir las herramientas de…

Impacto medio Fiabilidad fuente primaria Hugging Face

TutorMoments: AI2 mide si los modelos saben cuándo ayudar y cuándo no en tutoría

AI2 ha presentado TutorMoments, un marco de evaluación que mide si los LLMs pueden equilibrar el dilema pedagógico fundamental en tutoría: cuándo intervenir y…

Por qué importaEste trabajo identifica un sesgo fundamental en los LLMs entrenados como asistentes: su inclinación hacia la utilidad máxima interfiere con pedagogía…

Impacto medio Fiabilidad fuente primaria Hugging Face
Investigación 2 fuentes

Google DeepMind lanza FACTS Benchmark Suite para evaluar factualidad en LLMs

Google DeepMind y Kaggle han presentado el FACTS Benchmark Suite, un conjunto sistemático de evaluación de la factualidad en modelos de lenguaje grandes. El…

Por qué importaLa factualidad es un problema crítico en LLMs usados para entrega de información. Un benchmark sistemático y público, gestionado por una plataforma…

Impacto alto Fiabilidad confirmado por varias fuentes Google DeepMind

Every Eval Ever y Community Evals: unificación de evaluaciones de modelos de IA

Hugging Face integró su iniciativa Community Evals con Every Eval Ever (EEE), un proyecto de la EvalEval Coalition lanzado en febrero de 2026 para estandarizar…

Por qué importaLa fragmentación actual de evaluaciones (distintas puntuaciones del mismo modelo en la misma prueba según quién la ejecute, como LLaMA 65B con 63,7…

Impacto medio Fiabilidad fuente primaria Hugging Face

OpenAI contribuye a estándares compartidos para IA avanzada

OpenAI ha participado en la construcción de estándares compartidos para IA avanzada, apoyando marcos de evaluación, prácticas de seguridad y cooperación global…

Por qué importaLos estándares comunes son críticos para garantizar que el desarrollo de IA avanzada sea seguro y responsable, facilitando la interoperabilidad y la…

Impacto medio Fiabilidad una fuente fiable OpenAI