SWE-Bench Pro Score
Resolve rate on SWE-Bench Pro, a contamination-resistant benchmark for real-world software engineering ability.
Measured in % · Higher is better · Weight in overall score: 0.25
Top models by SWE-Bench Pro Score
| # | Name | Value | Confidence |
|---|---|---|---|
| 1 | Claude Opus 4.8Anthropic | 69.2% | Verified · 2+ sources |
| 2 | GPT-5.5OpenAI | 58.6% | Verified · 2+ sources |
| 3 | Gemini 3.1 Pro PreviewGoogle | 54.2% | Verified · 2+ sources |
| 4 | Claude Haiku 4.5 (latest)Anthropic | 39.45% | Verified · 2+ sources |
| 5 | Kimi K2.6Moonshot AI | 27.3% | Single source |
| 6 | DeepSeek V4 ProDeepSeek | 18% | Single source |
| 7 | Claude Sonnet 4.6Anthropic | 14.9% | Single source |
| 8 | Llama 4 Maverick 17B InstructMeta | 5.24% | Verified · 2+ sources |