CompareLLM
CompareLLM.ai
Live
Leaderboard
Models
Compare
Best of & Stacks
Research & News
…
CompareLLM
CompareLLM.ai
Precision Benchmarks

Programmatic, dated AI model benchmarks, head-to-head comparisons, and Stack Engine presets.

Daily ingest · 06:00 UTC

Analytics & Benchmarks

  • AI Model Leaderboard
  • Head-to-Head Compare Hub
  • Models Directory
  • Stack Engine Presets
  • Frontier Models
  • Open Weights Catalog

Guides & Intent Lists

  • Best LLM Lists (2026)
  • Best Coding LLM
  • Best Cheap LLM
  • Fastest Low-Latency LLM
  • Claude vs GPT Benchmark
  • What is Elo?
  • Methodology Guides
  • News & Dispatches

Transparency & API

  • Evaluation Methodology
  • Benchmark Changelog
  • Public JSON API
  • llms.txt Specification
  • Privacy Policy
  • Sign In / Account

© 2026 CompareLLM. Public benchmark data aggregated from Arena Elo, LiveBench, SWE-bench & OpenRouter.

Every score has a dated snapshot.

Theme:
Currency:
  1. Home
  2. Stack Engine
  3. frontier agents
Deterministic Stack Engine

Best AI Stack for frontier agents

Coding + preference Elo for computer-use and multi-step tools.

Objective Weight Distribution
SWE-bench:35%Elo:25%Speed:15%TTFT:10%Out $:15%
Recommended PickScore 79.2 / 100

Gemini 3.7 Flash

Google · Closed flagship

SWE-bench: 72.4% (Top 21%)Elo: 1,530 (Top 23%)Speed: 215 tok/s (Top 1%)TTFT: 82 ms (Top 1%)
Output: $1.875/1MSWE-bench: 72.4%
View full model fact sheet

Full Stack Leaderboard

Ranked alternatives optimized for frontier agents based on objective benchmark weighting.

#2Gemini 3 Flash(Google)
Score 76.9
SWE-bench75.8%Elo1,495Speed190 tok/sTTFT95 ms
Rank #2 in stackvs #1
#3DeepSeek V4 Flash(DeepSeek)
Score 73.5
SWE-bench71.2%Elo1,490Speed142 tok/sTTFT165 ms
Rank #3 in stackvs #1
#4Gemini 3.6 Flash(Google)
Score 72.0
SWE-bench70.8%Elo1,506Speed198 tok/sTTFT92 ms
Rank #4 in stackvs #1
#5GLM-5.3(Zhipu)
Score 71.2
SWE-bench76.4%Elo1,558Speed90 tok/sTTFT255 ms
Rank #5 in stackvs #1
#6Gemini 3.6 Pro(Google)
Score 71.0
SWE-bench74.6%Elo1,570Speed102 tok/sTTFT205 ms
Rank #6 in stackvs #1
#7OpenAI: o3 Mini(OpenAI)
Score 70.5
SWE-bench78.5%Elo1,560Speed92 tok/sTTFT290 ms
Rank #7 in stackvs #1
#8Claude Sonnet 5(Anthropic)
Score 70.3
SWE-bench73.8%Elo1,556Speed118 tok/sTTFT175 ms
Rank #8 in stackvs #1
#9GPT-5.6 Terra(OpenAI)
Score 67.3
SWE-bench70.4%Elo1,548Speed128 tok/sTTFT160 ms
Rank #9 in stackvs #1
#10GPT-5.6 Sol(OpenAI)
Score 66.8
SWE-bench77.6%Elo1,608Speed84 tok/sTTFT270 ms
Rank #10 in stackvs #1