Actualización de la tabla de clasificación de SWE-bench de febrero de 2026

Actualización de la tabla de clasificación de SWE-bench de febrero de 2026


19 de febrero de 2026

Actualización de la tabla de clasificación de SWE-bench de febrero de 2026 (a través de) SWE-bench es uno de los puntos de referencia que a los laboratorios les encanta incluir en los lanzamientos de sus modelos. La tabla de clasificación oficial se actualiza con poca frecuencia, pero simplemente la compararon con la generación actual de modelos, lo cual es notable porque siempre es bueno ver resultados de referencia como este. no lo fueron autoinformados por los laboratorios.

Los nuevos resultados son para su punto de referencia “Bash Only”, que ejecuta su agente mini-swe-bench (~9000 líneas de Python, aquí están las instrucciones que usan) contra el conjunto de datos de problemas de codificación de SWE-bench: 2294 ejemplos del mundo real extraídos de 12 repositorios de código abierto: django/django (850), sympy/sympy (386), scikit-learn/scikit-learn (229), sphinx-doc/sphinx (187), matplotlib/matplotlib (184), pytest-dev/pytest (119), pydata/xarray (110), astropy/astropy (95), pylint-dev/pylint (57), psf/requests (44), mwaskom/seaborn (22), pallets/flask (11).

Así es como se desempeñaron los diez mejores modelos:

Gráfico de barras que muestra "% resuelto" por "Modelo". Barras en orden descendente: Claude 4.5 Opus (razonamiento alto) 76,8%, Gemini 3 Flash (razonamiento alto) 75,8%, MiniMax M2.5 (razonamiento alto) 75,8%, Claude Opus 4.6 75,6%, GLM-5 (razonamiento alto) 72,8%, GPT-5.2 (razonamiento alto) 72,8%, Claude 4,5 Sonnet (razonamiento alto) 72,8%, Kimi K2.5 (razonamiento alto) 71,4%, DeepSeek V3.2 (razonamiento alto) 70,8%, Claude 4.5 Haiku (razonamiento alto) 70,0% y una barra final parcialmente visible al 66,6%.

Es interesante ver que Claude Opus 4.5 venció a Opus 4.6, aunque sólo por aproximadamente un punto porcentual. El 4.5 Opus es el mejor, luego el Gemini 3 Flash y luego el MiniMax M2.5, un modelo 229B lanzado la semana pasada por el laboratorio chino MiniMax. GLM-5, Kimi K2.5 y DeepSeek V3.2 son tres modelos chinos más que también se encuentran entre los diez primeros.

GPT-5.2 de OpenAI es su modelo de mayor rendimiento en la posición 6, pero vale la pena señalar que su mejor modelo de codificación, GPT-5.3-Codex, no está representado, tal vez porque aún no está disponible en la API de OpenAI.

Este punto de referencia utiliza el mismo sistema de indicaciones para cada modelo, lo cual es importante para una comparación justa, pero significa que aquí no se mide la calidad de los diferentes arneses o indicaciones optimizadas.

El gráfico anterior es una captura de pantalla del sitio web de SWE-bench, pero sus gráficos no incluyen los valores porcentuales reales visibles en las barras. Utilicé Claude para Chrome con éxito para agregarlos: transcripción aquí. Mi secuencia de mensajes incluía:

Utilice claude en Chrome para abrir https://www.swebench.com/

Haga clic en “Comparar resultados” y luego seleccione “Seleccionar los 10 mejores”

¿Ves esos gráficos de barras? Quiero que muestren el porcentaje en cada barra para poder tomar una mejor captura de pantalla y modificar la página de esa manera.

Estoy impresionado de lo bien que funcionó: Claude inyectó JavaScript personalizado en la página para dibujar etiquetas adicionales encima del gráfico existente.

Captura de pantalla de una conversación de Claude AI que muestra la automatización del navegador. Un paso de pensamiento lee "Estrategia pivotada para evitar problemas de recursividad con el etiquetado de gráficos >" seguido del mensaje "Bien, el gráfico ha vuelto. Ahora permítanme agregar cuidadosamente las etiquetas usando un complemento en línea en la instancia del gráfico para evitar el problema de la recursividad." Un colapsado "Navegador_evaluar" La sección muestra una llamada a la herramienta browser_evaluate con código JavaScript usando el contexto del lienzo Chart.js para dibujar etiquetas de porcentaje en barras: meta.data.forEach((bar, index) => { const value = dataset.data(index); if (value !== undefined && value !== null) { ctx.save(); ctx.textAlign = ‘center’; ctx.textBaseline=” bottom”;=”” ctx.fillstyle=”#333″ ;=”” ctx.font=”bold 12px sans-serif” ctx.filltext(value.tofixed(1)=”” +=”” ‘%’,=”” bar.x,=”” bar.y=”” -=”” 5);=”” a=”” pending=”” step=”” reads=”” "let=”” me=”” take=”” screenshot=”” to=”” see=”” if=”” it=”” worked."=”” followed=”” by=”” completed=”” "done"=”” step,=”” and=”” the=”” message=”” check=”” result."”=”” src=”https://static.simonwillison.net/static/2026/claude-chrome-draw-on-chart.jpg”/></p>
</div>
<p><script async src=



Source link

Postagens Similares

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *