Claude Opus 4.5 lidera el benchmark SWE-bench de febrero 2026
El SWE-bench acaba de publicar resultados independientes (no auto-reportados por los laboratorios) de su benchmark de resolución de problemas de código contra…
Por qué importaEs relevante para directivos de empresas que invierten en IA para desarrollo porque muestra qué modelos son más efectivos en automatización de código…
Impacto medio
Fiabilidad una fuente fiable
Relevancia 7/10
Simon Willison
