Actualización de la tabla de clasificación de SWE-bench de febrero de 2026
19 de febrero de 2026
Actualización de la tabla de clasificación de SWE-bench de febrero de 2026 (a través de) SWE-bench es uno de los puntos de referencia que a los laboratorios les encanta incluir en los lanzamientos de sus modelos. La tabla de clasificación oficial se actualiza con poca frecuencia, pero simplemente la compararon con la generación actual de modelos, lo cual es notable porque siempre es bueno ver resultados de referencia como este. no lo fueron autoinformados por los laboratorios.
Los nuevos resultados son para su punto de referencia “Bash Only”, que ejecuta su agente mini-swe-bench (~9000 líneas de Python, aquí están las instrucciones que usan) contra el conjunto de datos de problemas de codificación de SWE-bench: 2294 ejemplos del mundo real extraídos de 12 repositorios de código abierto: django/django (850), sympy/sympy (386), scikit-learn/scikit-learn (229), sphinx-doc/sphinx (187), matplotlib/matplotlib (184), pytest-dev/pytest (119), pydata/xarray (110), astropy/astropy (95), pylint-dev/pylint (57), psf/requests (44), mwaskom/seaborn (22), pallets/flask (11).
Así es como se desempeñaron los diez mejores modelos:

Es interesante ver que Claude Opus 4.5 venció a Opus 4.6, aunque sólo por aproximadamente un punto porcentual. El 4.5 Opus es el mejor, luego el Gemini 3 Flash y luego el MiniMax M2.5, un modelo 229B lanzado la semana pasada por el laboratorio chino MiniMax. GLM-5, Kimi K2.5 y DeepSeek V3.2 son tres modelos chinos más que también se encuentran entre los diez primeros.
GPT-5.2 de OpenAI es su modelo de mayor rendimiento en la posición 6, pero vale la pena señalar que su mejor modelo de codificación, GPT-5.3-Codex, no está representado, tal vez porque aún no está disponible en la API de OpenAI.
Este punto de referencia utiliza el mismo sistema de indicaciones para cada modelo, lo cual es importante para una comparación justa, pero significa que aquí no se mide la calidad de los diferentes arneses o indicaciones optimizadas.
El gráfico anterior es una captura de pantalla del sitio web de SWE-bench, pero sus gráficos no incluyen los valores porcentuales reales visibles en las barras. Utilicé Claude para Chrome con éxito para agregarlos: transcripción aquí. Mi secuencia de mensajes incluía:
Utilice claude en Chrome para abrir https://www.swebench.com/
Haga clic en “Comparar resultados” y luego seleccione “Seleccionar los 10 mejores”
¿Ves esos gráficos de barras? Quiero que muestren el porcentaje en cada barra para poder tomar una mejor captura de pantalla y modificar la página de esa manera.
Estoy impresionado de lo bien que funcionó: Claude inyectó JavaScript personalizado en la página para dibujar etiquetas adicionales encima del gráfico existente.
