Claude Opus 4.5 lidera el benchmark SWE-bench de febrero 2026

Hecho Qué ha ocurrido
El SWE-bench acaba de publicar resultados independientes (no auto-reportados por los laboratorios) de su benchmark de resolución de problemas de código contra la generación actual de modelos. Claude Opus 4.5 encabeza la clasificación, seguido por Gemini 3 Flash y MiniMax M2.5. La prueba utiliza 500 muestras verificadas de problemas de código real de repositorios de código abierto, evaluando cómo cada modelo completa tareas de desarrollo de software.
Resumen generado mediante IA a partir de Simon Willison (original en inglés). Naturaleza de la información: hecho documentado.
Análisis Por qué importa
Es relevante para directivos de empresas que invierten en IA para desarrollo porque muestra qué modelos son más efectivos en automatización de código en el mundo real. Los resultados independientes (no promovidos por los proveedores) ofrecen una visión más confiable sobre las capacidades reales de competencia entre modelos líderes.
- Quién se ve afectado
- Equipos de desarrollo de software, empresas que evalúan adopción de agentes de código, y proveedores de modelos de lenguaje.
- Qué puede cambiar
- Las decisiones sobre qué modelo adoptar para automatización de programación deberían basarse en estos datos independientes en lugar de afirmaciones de marketing. El dominio creciente de modelos chinos (MiniMax, GLM-5, Kimi, DeepSeek) en tareas de código sugiere una diversificación del panorama competitivo.
Análisis generado a partir de la información disponible; no procede de la fuente.
Predicción Qué observar a continuación
Disponibilidad de GPT-5.3-Codex en la API de OpenAI (actualmente ausente del benchmark). Próximas actualizaciones del benchmark para incluir modelos emergentes. Adopción de estos modelos en plataformas empresariales de desarrollo y CI/CD. Posibles mejoras de Opus 4.6 en iteraciones futuras.
Recomendación Qué debería hacer una empresa
Empresas con equipos de desarrollo deberían evaluar Claude Opus 4.5 y Gemini 3 Flash para tareas de automatización de código en los próximos 3-6 meses, usando SWE-bench Verified como referencia de rendimiento real.
Recomendación generada por IA con la evidencia disponible; no es asesoramiento profesional.
Enviar esta noticia por correo
Fuente original: Simon Willison. La referencia es siempre el artículo original.
Ver fuente original ↗LLMagentescodingIA generativa AnthropicGoogle DeepMindOpenAIMiniMax agentesbenchmarkscomparativadesarrollo de códigomodelos de lenguaje
Tu opinión
0 comentarios
Relacionadas
GPT-6 Astra lidera benchmark de matemáticas pese a no ser prioridad de OpenAI
OpenAI's GPT-6 Astra obtuvo el primer puesto en ErdosBench, un benchmark de 226 problemas matemáticos abiertos inspirados en los problemas de Erdős, con una…
Por qué importaMuestra que incluso el laboratorio líder en IA enfrenta compromisos de optimización: mejorar en un dominio implica sacrificar avances en otros…
OpenAI lanza GPT-6 Astra, su modelo más avanzado para uso empresarial
OpenAI ha presentado GPT-6 Astra, descrito como su modelo más capaz orientado al trabajo. El anuncio destaca mejoras en razonamiento avanzado, uso de ordenador…
Por qué importaUn salto de capacidad en el modelo insignia de OpenAI redefine el estándar de referencia para agentes y asistentes empresariales, afectando a toda la…
OpenAI lanza GPT-6 Astra y un desarrollador simula el conectoma de una mosca en Minecraft
Un desarrollador del Georgia Institute of Technology, Evan Sinclair, usó GPT-6 Astra de OpenAI para simular las 166.700 neuronas del conectoma de una mosca de…
Por qué importaLa demostración ilustra capacidades avanzadas de razonamiento y manejo de datos científicos del nuevo modelo, aunque las declaraciones sobre AGI son…
GPT-6 Astra de OpenAI reaviva el debate sobre si se alcanzó la IA general
OpenAI lanzó GPT-6 Astra, que muestra mejoras notables en tareas de agente, automatización y programación frente a GPT-5.6 Sol, según benchmarks como OSWorld…
Por qué importaMás allá de la etiqueta de AGI, Astra consolida la transición del chatbot al 'agente' capaz de ejecutar flujos de trabajo completos con mínima…



