LLM Benchmarks
Source-backed measurements
Compare 100 AI models across overall capability, knowledge, coding and agents—with sources, test dates and transparent comparison rules.
| Overview | Knowledge and reasoning | Coding | Agents and tools | |||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| ECI rank ↓ · Model | ECI, Overview, Epoch Capabilities Index: 82/100 measured models; 82 comparable. Canonical protocol: Epoch ECI snapshot 2026-10-01 · official-composite-fit · Epoch Capabilities Index. Best comparable first.Info | AA Index, Overview, Artificial Analysis Intelligence Index: 58/100 measured models; 58 comparable, 1 sharing a place. Canonical protocol: Artificial Analysis Intelligence Index v4.3 · intelligence-index-v4-3 · Artificial Analysis · Intelligence Index evaluations. Sort.Info | Arena, Overview, Arena Text: 80/100 measured models; 80 comparable, 23 sharing a place. Canonical protocol: 2026-09-30 · overall-style-control · Arena Text. Sort.Info | LiveBench, Overview, LiveBench: 55/100 measured models; 55 comparable. Canonical protocol: 2026-06-25 · overall-seven-category · LiveBench. Sort.Info | HLE Full, Knowledge and reasoning, Humanity's Last Exam · Full multimodal: 54/100 measured models; 16 comparable, 38 with a different protocol, 1 sharing a place. Canonical protocol: HLE finalized 2,500 · Scale protocol 2025-04-03 · full-multimodal-2500-no-tools · Scale AI Labs · Humanity's Last Exam Full. Sort.Info | GPQA, Knowledge and reasoning, GPQA Diamond: 89/100 measured models; 56 comparable, 33 with a different protocol, 27 sharing a place. Canonical protocol: GPQA Diamond v1 · Vals dual-prompt · diamond-198-zero-and-five-shot-cot · Vals AI GPQA Diamond. Sort.Info | MMLU-Pro, Knowledge and reasoning, MMLU-Pro: 66/100 measured models; 57 comparable, 9 with a different protocol, 14 sharing a place. Canonical protocol: Vals MMLU-Pro v1 · vals-mmlu-pro-overall · Vals AI · MMLU-Pro. Sort.Info | FrontierMath T1–3, Knowledge and reasoning, FrontierMath T1–3: 64/100 measured models; 64 comparable, 16 sharing a place. Canonical protocol: 2.0.0 · private-285-of-295-problem-tiers-1-3-set · Epoch AI · FrontierMath Tiers 1–3 v2. Sort.Info | SWE-bench, Coding, SWE-bench Verified: 60/100 measured models; 60 comparable, 18 sharing a place. Canonical protocol: SWE-bench Verified v1 · verified-500-vals-mini-swe-agent · Vals AI SWE-bench Verified. Shows only Vals AI's uniform 500-task mini-swe-agent/Bash evaluation. This is the default directly comparable view. Sort.Info | SWE-rebench, Coding, SWE-rebench v2: 38/100 measured models; 13 comparable, 8 directly comparable with a contamination warning, 25 with a different protocol. Canonical protocol: rolling-v2 · 2026-05-15/2026-07-01 · SWE-rebench. Shows the latest shared SWE-rebench task window. Contamination warnings remain visible and do not change the task-window match. 2026-05-15/2026-07-01 Sort.Info | LiveCodeBench, Coding, LiveCodeBench: 63/100 measured models; 55 comparable, 8 with a different protocol, 8 sharing a place. Canonical protocol: Vals LiveCodeBench v1 · vals-livecodebench-overall · Vals AI · LiveCodeBench. Sort.Info | SciCode, Coding, SciCode: 79/100 measured models; 70 comparable, 9 with a different protocol, 8 sharing a place. Canonical protocol: SciCode current leaderboard · scientific-research-coding-subproblems · Epoch AI mirror · SciCode. Sort.Info | Terminal 2.1, Agents and tools, Terminal-Bench 2.1: 67/100 measured models; 58 comparable, 9 with a different protocol, 12 sharing a place. Canonical protocol: Vals Terminal-Bench 2.1 v2.1 · vals-terminal-bench-2-1-overall · Vals AI · Terminal-Bench 2.1. Sort.Info | MCP-Atlas, Agents and tools, MCP-Atlas · Scale: 24/100 measured models; 23 comparable, 1 with a different protocol, 2 sharing a place. Canonical protocol: MCP-Atlas April 2026 rescored protocol · all-1000-public-500-private-500 · Scale AI Labs · MCP-Atlas. Sort.Info | APEX, Agents and tools, APEX-Agents: 53/100 measured models; 53 comparable, 3 sharing a place. Canonical protocol: APEX-Agents current leaderboard · 480-professional-tasks-33-worlds · Epoch AI mirror · APEX-Agents. Sort.Info | GDPval-AA v2.1, Agents and tools, GDPval-AA v2.1: 76/100 measured models; 76 comparable, 2 sharing a place. Canonical protocol: GDPval-AA v2.1 (Crowd-BT Elo, DeepSeek V4.1 Flash (max) at 1600) · 220-tasks-elo-v2-1 · Artificial Analysis · Intelligence Index evaluations. Sort.Info |
| Rank 1Claude Opus 5.510/16 measured · 9 comparable | ||||||||||||||||
| Rank 2GPT 6 astra11/16 measured · 10 comparable | ||||||||||||||||
| Rank 3Claude Sonnet 5.59/16 measured · 8 comparable | ||||||||||||||||
| Rank 4Claude Fable 5.113/16 measured · 12 comparable | ||||||||||||||||
| Rank 5Claude Opus 516/16 measured · 15 comparable | ||||||||||||||||
| Rank 6GPT 5.5 Pro3/16 measured · 2 comparable | ||||||||||||||||
| Rank 7Claude Fable 515/16 measured · 15 comparable | ||||||||||||||||
| Rank 8GPT 5.6 Sol15/16 measured · 15 comparable | ||||||||||||||||
| Rank 9GPT 5.6 Terra13/16 measured · 13 comparable | ||||||||||||||||
| Rank 10GPT 5.515/16 measured · 13 comparable | ||||||||||||||||
| Rank 11GPT 5.4 Pro4/16 measured · 3 comparable | ||||||||||||||||
| Rank 12Claude Opus 4.815/16 measured · 13 comparable | ||||||||||||||||
| Rank 13Kimi K315/16 measured · 14 comparable | ||||||||||||||||
| Rank 14Gemini 3.7 Flash13/16 measured · 13 comparable | ||||||||||||||||
| Rank 15Gemini 3.8 Flash14/16 measured · 14 comparable | ||||||||||||||||
| Rank 16GPT 5.414/16 measured · 13 comparable | ||||||||||||||||
| Rank 17Muse Spark 1 310/16 measured · 9 comparable | ||||||||||||||||
| Rank 18GPT 5.3 Codex7/16 measured · 5 comparable | ||||||||||||||||
| Rank 19Grok 4.613/16 measured · 13 comparable | ||||||||||||||||
| Rank 20Qwen 3.8 Max12/16 measured · 12 comparable | ||||||||||||||||
| Rank 21GPT 5.6 Luna12/16 measured · 12 comparable | ||||||||||||||||
| Rank 22Claude Opus 4.715/16 measured · 14 comparable | ||||||||||||||||
| Rank 23Claude Sonnet 515/16 measured · 14 comparable | ||||||||||||||||
| Rank 24GLM 5.314/16 measured · 13 comparable | ||||||||||||||||
| Rank 25GPT 5.2 Pro2/16 measured · 2 comparable | ||||||||||||||||
| Rank 26DeepSeek V4 Pro (2026-08-13)14/16 measured · 13 comparable | ||||||||||||||||
| Rank 27Claude Opus 4.612/16 measured · 11 comparable | ||||||||||||||||
| Rank 28Qwen 3.8 Max (0902)6/16 measured · 5 comparable | ||||||||||||||||
| Rank 29DeepSeek V4.1 Flash8/16 measured · 7 comparable | ||||||||||||||||
| Rank 30Muse Spark 1.211/16 measured · 10 comparable | ||||||||||||||||
| Rank 31Gemini 3.1 Pro16/16 measured · 15 comparable | ||||||||||||||||
| Rank 32DeepSeek V4 Flash (0731)12/16 measured · 11 comparable | ||||||||||||||||
| Rank 33Gemini 3.5 Flash16/16 measured · 14 comparable | ||||||||||||||||
| Rank 34Gemini 3.6 Flash13/16 measured · 13 comparable | ||||||||||||||||
| Rank 35Muse Spark 1.113/16 measured · 12 comparable | ||||||||||||||||
| Rank 36Grok 4.514/16 measured · 14 comparable | ||||||||||||||||
| Rank 37Qwen 3.7 Max11/16 measured · 11 comparable | ||||||||||||||||
| Rank 38GPT 5.211/16 measured · 10 comparable | ||||||||||||||||
| Rank 39Gemini 3 Pro10/16 measured · 9 comparable | ||||||||||||||||
| Rank 40Claude Sonnet 4.615/16 measured · 13 comparable | ||||||||||||||||
| Rank 41Muse Spark9/16 measured · 9 comparable | ||||||||||||||||
| Rank 42Grok 4.208/16 measured · 8 comparable | ||||||||||||||||
| Rank 43GLM 5.3 Flash14/16 measured · 13 comparable | ||||||||||||||||
| Rank 44Gemini 3 Flash11/16 measured · 9 comparable | ||||||||||||||||
| Rank 45GLM 5.216/16 measured · 15 comparable | ||||||||||||||||
| Rank 46Kimi K2.614/16 measured · 12 comparable | ||||||||||||||||
| Rank 47GPT 5 Pro3/16 measured · 3 comparable | ||||||||||||||||
| Rank 48Inkling Small13/16 measured · 12 comparable | ||||||||||||||||
| Rank 49Claude Opus 4.511/16 measured · 10 comparable | ||||||||||||||||
| Rank 50Kimi K2.7 Code11/16 measured · 10 comparable | ||||||||||||||||
| Rank 51GPT 511/16 measured · 10 comparable | ||||||||||||||||
| Rank 52GLM 5.114/16 measured · 12 comparable | ||||||||||||||||
| Rank 53GPT 5.110/16 measured · 10 comparable | ||||||||||||||||
| Rank 54Qwen 3.8 27B12/16 measured · 11 comparable | ||||||||||||||||
| Rank 55Qwen 3.6 Max Preview4/16 measured · 3 comparable | ||||||||||||||||
| Rank 56Grok 4.313/16 measured · 12 comparable | ||||||||||||||||
| Rank 57DeepSeek V4 Pro (2026-04-22)14/16 measured · 13 comparable | ||||||||||||||||
| Rank 58GPT 5.4 Mini12/16 measured · 12 comparable | ||||||||||||||||
| Rank 59Inkling15/16 measured · 14 comparable | ||||||||||||||||
| Rank 60Kimi K2.512/16 measured · 11 comparable | ||||||||||||||||
| Rank 61Qwen 3.6 Plus11/16 measured · 11 comparable | ||||||||||||||||
| Rank 62Qwen 3.7 Plus9/16 measured · 7 comparable | ||||||||||||||||
| Rank 63MiniMax M314/16 measured · 13 comparable | ||||||||||||||||
| Rank 64Claude Sonnet 4.512/16 measured · 11 comparable | ||||||||||||||||
| Rank 65Qwen 3.5 397B-A17B12/16 measured · 6 comparable | ||||||||||||||||
| Rank 66Qwen 3.6 27B13/16 measured · 8 comparable | ||||||||||||||||
| Rank 67DeepSeek V4 Flash (2026-04-22)9/16 measured · 5 comparable | ||||||||||||||||
| Rank 68GLM 59/16 measured · 7 comparable | ||||||||||||||||
| Rank 69GPT 5.4 Nano12/16 measured · 12 comparable | ||||||||||||||||
| Rank 70Gemini 2.5 Pro9/16 measured · 7 comparable | ||||||||||||||||
| Rank 71Gemini 3.5 Flash Lite12/16 measured · 12 comparable | ||||||||||||||||
| Rank 72Gemini 3.1 Flash Lite13/16 measured · 13 comparable | ||||||||||||||||
| Rank 73Claude Opus 4.17/16 measured · 6 comparable | ||||||||||||||||
| Rank 74Qwen 3.6 35B-A3B11/16 measured · 6 comparable | ||||||||||||||||
| Rank 75Gemma 4 31B IT6/16 measured · 2 comparable | ||||||||||||||||
| Rank 76Qwen 3.5 35B-A3B11/16 measured · 6 comparable | ||||||||||||||||
| Rank 77GPT 5.5 Instant5/16 measured · 4 comparable | ||||||||||||||||
| Rank 78mistral Medium 3.59/16 measured · 8 comparable | ||||||||||||||||
| Rank 79Qwen 3.5 9B8/16 measured · 4 comparable | ||||||||||||||||
| Rank 80Qwen 3 32B5/16 measured · 4 comparable | ||||||||||||||||
| Rank 81Qwen 3 14B4/16 measured · 3 comparable | ||||||||||||||||
| Rank 82GPT 4.52/16 measured · 2 comparable | ||||||||||||||||
| 18 models without a directly comparable ECI score | ||||||||||||||||
| No rankGemini 4 argon4/16 measured · 3 comparable | ||||||||||||||||
| No rankGPT 6 Sol9/16 measured · 8 comparable | ||||||||||||||||
| No rankGrok 4.76/16 measured · 6 comparable | ||||||||||||||||
| No rankGPT 6 Luna9/16 measured · 8 comparable | ||||||||||||||||
| No rankMiMo V2.6 Pro5/16 measured · 4 comparable | ||||||||||||||||
| No rankGLM 5.3 Max1/16 measured · 1 comparable | ||||||||||||||||
| No rankGPT 5.2 Chat Latest (2026-02-10)1/16 measured · 1 comparable | ||||||||||||||||
| No rankMiMo V2.5 Pro11/16 measured · 10 comparable | ||||||||||||||||
| No rankHY37/16 measured · 3 comparable | ||||||||||||||||
| No rankGrok 4.12/16 measured · 2 comparable | ||||||||||||||||
| No rankQwen 3.5 27B6/16 measured · 1 comparable | ||||||||||||||||
| No rankQwen 3.8 Flash Next7/16 measured · 3 comparable | ||||||||||||||||
| No rankGemma 4 12B IT4/16 measured · 0 comparable | ||||||||||||||||
| No rankGemma 4 26B-A4B IT4/16 measured · 0 comparable | ||||||||||||||||
| No rankQwen 3.8 2.4T-A95B6/16 measured · 3 comparable | ||||||||||||||||
| No rankMiMo V2.6 Flash5/16 measured · 4 comparable | ||||||||||||||||
| No rankGPT 6.1 Sol7/16 measured · 6 comparable | ||||||||||||||||
| No rankGemma 4 31B7/16 measured · 3 comparable | ||||||||||||||||