OpenAI deja de evaluar SWE-bench Verified por contaminación de datos y filtraciones
OpenAI ha publicado un análisis técnico indicando que SWE-bench Verified, un benchmark estándar para evaluar capacidades de codificación en modelos de IA…
Por qué importaLos benchmarks son referentes clave para comparar y validar el desempeño real de modelos de IA frontier en tareas técnicas; si los tests están…
Impacto medio
Fiabilidad fuente primaria
Relevancia 7/10
OpenAI
