CompareLLM.ai
Live
Leaderboard
Models
Compare
Best of & Stacks
Research & News
…
CompareLLM.ai
Precision Benchmarks

Programmatic, dated AI model benchmarks, head-to-head comparisons, and Stack Engine presets.

Daily ingest · 06:00 UTC

Analytics & Benchmarks

  • AI Model Leaderboard
  • Head-to-Head Compare Hub
  • Models Directory
  • Stack Engine Presets
  • Frontier Models
  • Open Weights Catalog

Guides & Intent Lists

  • Best LLM Lists (2026)
  • Best Coding LLM
  • Best Cheap LLM
  • Fastest Low-Latency LLM
  • Claude vs GPT Benchmark
  • What is Elo?
  • Methodology Guides
  • News & Dispatches

Transparency & API

  • Evaluation Methodology
  • Benchmark Changelog
  • Public JSON API
  • llms.txt Specification
  • Privacy Policy
  • Sign In / Account

© 2026 CompareLLM. Public benchmark data aggregated from Arena Elo, LiveBench, SWE-bench & OpenRouter.

Every score has a dated snapshot.

Theme:
Currency:
  1. Home
  2. Leaderboards
  3. SWE-bench
Benchmark Domain · %
▲ Higher is better

SWE-bench Leaderboard

All active models in our catalog ranked by verified SWE-bench snapshots. Showing 72 validated models.

Switch Leaderboard Metric:
All Metrics:EloCode EloLiveBenchSWE-benchGPQATTFTSpeedIn $Out $ContextImg EloGen TimeImg $Prompt %Text %
Current #1 Leader for SWE-bench
80%

Claude Fable 5

Anthropic · Proprietary · Frontier tier

swebench · Aug 16, 2026View full model fact sheet

Complete Ranked Roster

#1
Claude Fable 5Anthropic
swebench · Aug 16, 2026
80%Current Leader
#2
Claude Opus 5Anthropic
swebench · Aug 16, 2026
79.2%vs #1
#3
OpenAI: o3 MiniOpenAI
swebench · Aug 17, 2026
78.5%vs #1
#4
Claude Opus 4.8Anthropic
swebench · Aug 16, 2026
78.4%vs #1
#5
GPT-5.6 SolOpenAI
swebench · Aug 16, 2026
77.6%vs #1
#6
Claude Opus 4.5Anthropic
swebench · Aug 17, 2026
76.8%vs #1
#7
GLM-5.3Zhipu
swebench · Aug 16, 2026
76.4%vs #1
#8
Claude Opus 4.6Anthropic
swebench · Aug 17, 2026
75.9%vs #1
#9
Gemini 3 FlashGoogle
swebench · Aug 17, 2026
75.8%vs #1
#10
MiniMax M2.5MiniMaxOpen
swebench · Aug 17, 2026
75.8%vs #1
#11
Gemini 3.6 ProGoogle
swebench · Aug 16, 2026
74.6%vs #1
#12
Kimi K3Moonshot
swebench · Aug 17, 2026
73.8%vs #1
#13
Claude Sonnet 5Anthropic
swebench · Aug 16, 2026
73.8%vs #1
#14
Claude Opus 4Anthropic
swebench · Aug 17, 2026
72.5%vs #1
#15
Gemini 3 ProGoogle
swebench · Aug 17, 2026
72.4%vs #1
#16
Gemini 3.7 FlashGoogle
swebench · Aug 16, 2026
72.4%vs #1
#17
DeepSeek V4 ProDeepSeekOpen
swebench · Aug 17, 2026
71.6%vs #1
#18
MoonshotAI: Kimi K2.5Moonshot
swebench · Aug 17, 2026
71.3%vs #1
#19
DeepSeek V4 FlashDeepSeekOpen
swebench · Aug 16, 2026
71.2%vs #1
#20
GPT-4.5 OrionOpenAI
swebench · Aug 17, 2026
71%vs #1
#21
Gemini 3.6 FlashGoogle
swebench · Aug 16, 2026
70.8%vs #1
#22
GPT-5.6 TerraOpenAI
swebench · Aug 16, 2026
70.4%vs #1
#23
Claude 3.7 SonnetAnthropic
swebench · Aug 17, 2026
70.3%vs #1
#24
Claude Sonnet 4.5Anthropic
swebench · Aug 17, 2026
70.1%vs #1
#25
GLM-5.2ZhipuOpen
swebench · Aug 17, 2026
69.3%vs #1
#26
Grok 4.6xAI
swebench · Aug 16, 2026
69.1%vs #1
#27
GPT-5OpenAI
swebench · Aug 17, 2026
68.4%vs #1
#28
Qwen 3 MaxAlibaba
swebench · Aug 17, 2026
67.8%vs #1
#29
Qwen QwQ 32BAlibabaOpen
swebench · Aug 17, 2026
67.5%vs #1
#30
Gemini 2.0 Flash ThinkingGoogle
swebench · Aug 17, 2026
66.8%vs #1
#31
MoonshotAI: Kimi K2 0711Moonshot
swebench · Aug 17, 2026
65.8%vs #1
#32
DeepSeek R1DeepSeekOpen
swebench · Aug 17, 2026
65.2%vs #1
#33
Z.ai: GLM 5V TurboZhipu
seed-bootstrap · Aug 1, 2026
65.2%vs #1
#34
Qwen 2.5 Coder 32BAlibabaOpen
seed-bootstrap · Aug 1, 2026
65.2%vs #1
#35
Qwen2.5 Coder 32B InstructAlibaba
swebench · Aug 17, 2026
65.2%vs #1
#36
Gemini 2.5 ProGoogle
swebench · Aug 17, 2026
63.8%vs #1
#37
Yi-Lightning01.AI
swebench · Aug 17, 2026
63.4%vs #1
#38
Seed 2.1 TurboByteDance
swebench · Aug 16, 2026
63.2%vs #1
#39
Claude Sonnet 4Anthropic
swebench · Aug 17, 2026
62.8%vs #1
#40
Doubao Pro 1.5ByteDance
swebench · Aug 17, 2026
62.1%vs #1
#41
GPT-5.6 LunaOpenAI
swebench · Aug 16, 2026
61.8%vs #1
#42
DeepSeek Coder V2DeepSeekOpen
swebench · Aug 17, 2026
60.5%vs #1
#43
Qwen3 235BAlibabaOpen
swebench · Aug 17, 2026
59.4%vs #1
#44
Qwen 2.5 PlusAlibaba
swebench · Aug 17, 2026
59.2%vs #1
#45
Qwen3.8 27BAlibabaOpen
swebench · Aug 16, 2026
58.8%vs #1
#46
Grok 4xAI
swebench · Aug 17, 2026
58.6%vs #1
#47
Llama 3.1 405BMetaOpen
swebench · Aug 17, 2026
58.4%vs #1
#48
Claude Haiku 4.5Anthropic
swebench · Aug 16, 2026
58.2%vs #1
#49
Llama 4 MaverickMetaOpen
swebench · Aug 17, 2026
57.1%vs #1
#50
Ernie 4.5 TurboBaidu
swebench · Aug 17, 2026
57%vs #1
#51
OpenAI o1-miniOpenAI
swebench · Aug 17, 2026
56.4%vs #1
#52
Mistral Large 3Mistral
swebench · Aug 17, 2026
55.4%vs #1
#53
GPT-4oOpenAI
swebench · Aug 17, 2026
54.8%vs #1
#54
Yi-Large01.AI
swebench · Aug 17, 2026
53.8%vs #1
#55
GPT-5 miniOpenAI
swebench · Aug 17, 2026
52.4%vs #1
#56
Llama 4 ScoutMetaOpen
swebench · Aug 16, 2026
52.4%vs #1
#57
Codestral 25.01Mistral
swebench · Aug 17, 2026
51.8%vs #1
#58
Grok 3xAI
swebench · Aug 17, 2026
51.4%vs #1
#59
Kimi Chat 1.5Moonshot
swebench · Aug 17, 2026
51%vs #1
#60
Claude 3.5 SonnetAnthropic
swebench · Aug 17, 2026
49%vs #1
#61
OpenAI: o1OpenAI
swebench · Aug 17, 2026
48.9%vs #1
#62
DeepSeek V3DeepSeekOpen
swebench · Aug 17, 2026
48.6%vs #1
#63
Gemini 2.5 FlashGoogle
swebench · Aug 17, 2026
48%vs #1
#64
Doubao Lite 1.5ByteDance
swebench · Aug 17, 2026
46%vs #1
#65
Llama 3.3 70BMetaOpen
swebench · Aug 17, 2026
45.1%vs #1
#66
Command ACohere
swebench · Aug 17, 2026
42.6%vs #1
#67
GPT-4o miniOpenAI
swebench · Aug 17, 2026
41.2%vs #1
#68
Llama 3.1 70BMetaOpen
swebench · Aug 17, 2026
40.2%vs #1
#69
Claude 3 OpusAnthropic
swebench · Aug 17, 2026
38.4%vs #1
#70
Gemini 1.5 ProGoogle
swebench · Aug 17, 2026
38%vs #1
#71
Claude 3.5 HaikuAnthropic
swebench · Aug 17, 2026
36.2%vs #1
#72
GPT-4 TurboOpenAI
swebench · Aug 17, 2026
33.2%vs #1