OpenAI cuestiona la fiabilidad de SWE-Bench Pro en evaluación de modelos de código
OpenAI ha publicado un análisis que identifica problemas en SWE-Bench Pro, un benchmark ampliamente utilizado para evaluar modelos de IA en tareas de…
Por qué importaLa validez de los benchmarks es crucial para comparar objetivamente el rendimiento de modelos de IA; si SWE-Bench Pro es deficiente, las decisiones…
Impacto medio
Fiabilidad fuente primaria
OpenAI