LLM Benchmarks
Quellenbelegte Messwerte
Vergleiche 100 KI-Modelle nach Gesamtleistung, Wissen, Coding und Agentenfähigkeiten – mit Quellen, Testdaten und nachvollziehbaren Vergleichsregeln.
| Gesamt | Wissen und Reasoning | Coding | Agenten und Tools | |||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| ECI-Rang ↓ · Modell | ECI, Gesamt, Epoch Capabilities Index: 82/100 gemessene Modelle; 82 vergleichbar. Kanonisches Protokoll: Epoch ECI snapshot 2026-10-01 · official-composite-fit · Epoch Capabilities Index. Beste vergleichbare zuerst.Info | AA Index, Gesamt, Artificial Analysis Intelligence Index: 58/100 gemessene Modelle; 58 vergleichbar, 1 geteilte Plätze. Kanonisches Protokoll: Artificial Analysis Intelligence Index v4.3 · intelligence-index-v4-3 · Artificial Analysis · Intelligence Index evaluations. Sortieren.Info | Arena, Gesamt, Arena Text: 80/100 gemessene Modelle; 80 vergleichbar, 23 geteilte Plätze. Kanonisches Protokoll: 2026-09-30 · overall-style-control · Arena Text. Sortieren.Info | LiveBench, Gesamt, LiveBench: 55/100 gemessene Modelle; 55 vergleichbar. Kanonisches Protokoll: 2026-06-25 · overall-seven-category · LiveBench. Sortieren.Info | HLE Full, Wissen und Reasoning, Humanity's Last Exam · Full multimodal: 54/100 gemessene Modelle; 16 vergleichbar, 38 mit abweichendem Protokoll, 1 geteilte Plätze. Kanonisches Protokoll: HLE finalized 2,500 · Scale protocol 2025-04-03 · full-multimodal-2500-no-tools · Scale AI Labs · Humanity's Last Exam Full. Sortieren.Info | GPQA, Wissen und Reasoning, GPQA Diamond: 89/100 gemessene Modelle; 56 vergleichbar, 33 mit abweichendem Protokoll, 27 geteilte Plätze. Kanonisches Protokoll: GPQA Diamond v1 · Vals dual-prompt · diamond-198-zero-and-five-shot-cot · Vals AI GPQA Diamond. Sortieren.Info | MMLU-Pro, Wissen und Reasoning, MMLU-Pro: 66/100 gemessene Modelle; 57 vergleichbar, 9 mit abweichendem Protokoll, 14 geteilte Plätze. Kanonisches Protokoll: Vals MMLU-Pro v1 · vals-mmlu-pro-overall · Vals AI · MMLU-Pro. Sortieren.Info | FrontierMath T1–3, Wissen und Reasoning, FrontierMath T1–3: 64/100 gemessene Modelle; 64 vergleichbar, 16 geteilte Plätze. Kanonisches Protokoll: 2.0.0 · private-285-of-295-problem-tiers-1-3-set · Epoch AI · FrontierMath Tiers 1–3 v2. Sortieren.Info | SWE-bench, Coding, SWE-bench Verified: 60/100 gemessene Modelle; 60 vergleichbar, 18 geteilte Plätze. Kanonisches Protokoll: SWE-bench Verified v1 · verified-500-vals-mini-swe-agent · Vals AI SWE-bench Verified. Zeigt nur die einheitliche 500-Aufgaben-Auswertung von Vals AI mit mini-swe-agent und Bash. Dies ist die standardmäßige direkt vergleichbare Ansicht. Sortieren.Info | SWE-rebench, Coding, SWE-rebench v2: 38/100 gemessene Modelle; 13 vergleichbar, 8 direkt vergleichbar mit Kontaminationswarnung, 25 mit abweichendem Protokoll. Kanonisches Protokoll: rolling-v2 · 2026-05-15/2026-07-01 · SWE-rebench. Zeigt das neueste gemeinsame SWE-rebench-Aufgabenfenster. Kontaminationswarnungen bleiben sichtbar und ändern die Übereinstimmung des Zeitfensters nicht. 2026-05-15/2026-07-01 Sortieren.Info | LiveCodeBench, Coding, LiveCodeBench: 63/100 gemessene Modelle; 55 vergleichbar, 8 mit abweichendem Protokoll, 8 geteilte Plätze. Kanonisches Protokoll: Vals LiveCodeBench v1 · vals-livecodebench-overall · Vals AI · LiveCodeBench. Sortieren.Info | SciCode, Coding, SciCode: 79/100 gemessene Modelle; 70 vergleichbar, 9 mit abweichendem Protokoll, 8 geteilte Plätze. Kanonisches Protokoll: SciCode current leaderboard · scientific-research-coding-subproblems · Epoch AI mirror · SciCode. Sortieren.Info | Terminal 2.1, Agenten und Tools, Terminal-Bench 2.1: 67/100 gemessene Modelle; 58 vergleichbar, 9 mit abweichendem Protokoll, 12 geteilte Plätze. Kanonisches Protokoll: Vals Terminal-Bench 2.1 v2.1 · vals-terminal-bench-2-1-overall · Vals AI · Terminal-Bench 2.1. Sortieren.Info | MCP-Atlas, Agenten und Tools, MCP-Atlas · Scale: 24/100 gemessene Modelle; 23 vergleichbar, 1 mit abweichendem Protokoll, 2 geteilte Plätze. Kanonisches Protokoll: MCP-Atlas April 2026 rescored protocol · all-1000-public-500-private-500 · Scale AI Labs · MCP-Atlas. Sortieren.Info | APEX, Agenten und Tools, APEX-Agents: 53/100 gemessene Modelle; 53 vergleichbar, 3 geteilte Plätze. Kanonisches Protokoll: APEX-Agents current leaderboard · 480-professional-tasks-33-worlds · Epoch AI mirror · APEX-Agents. Sortieren.Info | GDPval-AA v2.1, Agenten und Tools, GDPval-AA v2.1: 76/100 gemessene Modelle; 76 vergleichbar, 2 geteilte Plätze. Kanonisches Protokoll: GDPval-AA v2.1 (Crowd-BT Elo, DeepSeek V4.1 Flash (max) at 1600) · 220-tasks-elo-v2-1 · Artificial Analysis · Intelligence Index evaluations. Sortieren.Info |
| Rang 1Claude Opus 5.510/16 Werte · 9 vergleichbar | ||||||||||||||||
| Rang 2GPT 6 astra11/16 Werte · 10 vergleichbar | ||||||||||||||||
| Rang 3Claude Sonnet 5.59/16 Werte · 8 vergleichbar | ||||||||||||||||
| Rang 4Claude Fable 5.113/16 Werte · 12 vergleichbar | ||||||||||||||||
| Rang 5Claude Opus 516/16 Werte · 15 vergleichbar | ||||||||||||||||
| Rang 6GPT 5.5 Pro3/16 Werte · 2 vergleichbar | ||||||||||||||||
| Rang 7Claude Fable 515/16 Werte · 15 vergleichbar | ||||||||||||||||
| Rang 8GPT 5.6 Sol15/16 Werte · 15 vergleichbar | ||||||||||||||||
| Rang 9GPT 5.6 Terra13/16 Werte · 13 vergleichbar | ||||||||||||||||
| Rang 10GPT 5.515/16 Werte · 13 vergleichbar | ||||||||||||||||
| Rang 11GPT 5.4 Pro4/16 Werte · 3 vergleichbar | ||||||||||||||||
| Rang 12Claude Opus 4.815/16 Werte · 13 vergleichbar | ||||||||||||||||
| Rang 13Kimi K315/16 Werte · 14 vergleichbar | ||||||||||||||||
| Rang 14Gemini 3.7 Flash13/16 Werte · 13 vergleichbar | ||||||||||||||||
| Rang 15Gemini 3.8 Flash14/16 Werte · 14 vergleichbar | ||||||||||||||||
| Rang 16GPT 5.414/16 Werte · 13 vergleichbar | ||||||||||||||||
| Rang 17Muse Spark 1 310/16 Werte · 9 vergleichbar | ||||||||||||||||
| Rang 18GPT 5.3 Codex7/16 Werte · 5 vergleichbar | ||||||||||||||||
| Rang 19Grok 4.613/16 Werte · 13 vergleichbar | ||||||||||||||||
| Rang 20Qwen 3.8 Max12/16 Werte · 12 vergleichbar | ||||||||||||||||
| Rang 21GPT 5.6 Luna12/16 Werte · 12 vergleichbar | ||||||||||||||||
| Rang 22Claude Opus 4.715/16 Werte · 14 vergleichbar | ||||||||||||||||
| Rang 23Claude Sonnet 515/16 Werte · 14 vergleichbar | ||||||||||||||||
| Rang 24GLM 5.314/16 Werte · 13 vergleichbar | ||||||||||||||||
| Rang 25GPT 5.2 Pro2/16 Werte · 2 vergleichbar | ||||||||||||||||
| Rang 26DeepSeek V4 Pro (2026-08-13)14/16 Werte · 13 vergleichbar | ||||||||||||||||
| Rang 27Claude Opus 4.612/16 Werte · 11 vergleichbar | ||||||||||||||||
| Rang 28Qwen 3.8 Max (0902)6/16 Werte · 5 vergleichbar | ||||||||||||||||
| Rang 29DeepSeek V4.1 Flash8/16 Werte · 7 vergleichbar | ||||||||||||||||
| Rang 30Muse Spark 1.211/16 Werte · 10 vergleichbar | ||||||||||||||||
| Rang 31Gemini 3.1 Pro16/16 Werte · 15 vergleichbar | ||||||||||||||||
| Rang 32DeepSeek V4 Flash (0731)12/16 Werte · 11 vergleichbar | ||||||||||||||||
| Rang 33Gemini 3.5 Flash16/16 Werte · 14 vergleichbar | ||||||||||||||||
| Rang 34Gemini 3.6 Flash13/16 Werte · 13 vergleichbar | ||||||||||||||||
| Rang 35Muse Spark 1.113/16 Werte · 12 vergleichbar | ||||||||||||||||
| Rang 36Grok 4.514/16 Werte · 14 vergleichbar | ||||||||||||||||
| Rang 37Qwen 3.7 Max11/16 Werte · 11 vergleichbar | ||||||||||||||||
| Rang 38GPT 5.211/16 Werte · 10 vergleichbar | ||||||||||||||||
| Rang 39Gemini 3 Pro10/16 Werte · 9 vergleichbar | ||||||||||||||||
| Rang 40Claude Sonnet 4.615/16 Werte · 13 vergleichbar | ||||||||||||||||
| Rang 41Muse Spark9/16 Werte · 9 vergleichbar | ||||||||||||||||
| Rang 42Grok 4.208/16 Werte · 8 vergleichbar | ||||||||||||||||
| Rang 43GLM 5.3 Flash14/16 Werte · 13 vergleichbar | ||||||||||||||||
| Rang 44Gemini 3 Flash11/16 Werte · 9 vergleichbar | ||||||||||||||||
| Rang 45GLM 5.216/16 Werte · 15 vergleichbar | ||||||||||||||||
| Rang 46Kimi K2.614/16 Werte · 12 vergleichbar | ||||||||||||||||
| Rang 47GPT 5 Pro3/16 Werte · 3 vergleichbar | ||||||||||||||||
| Rang 48Inkling Small13/16 Werte · 12 vergleichbar | ||||||||||||||||
| Rang 49Claude Opus 4.511/16 Werte · 10 vergleichbar | ||||||||||||||||
| Rang 50Kimi K2.7 Code11/16 Werte · 10 vergleichbar | ||||||||||||||||
| Rang 51GPT 511/16 Werte · 10 vergleichbar | ||||||||||||||||
| Rang 52GLM 5.114/16 Werte · 12 vergleichbar | ||||||||||||||||
| Rang 53GPT 5.110/16 Werte · 10 vergleichbar | ||||||||||||||||
| Rang 54Qwen 3.8 27B12/16 Werte · 11 vergleichbar | ||||||||||||||||
| Rang 55Qwen 3.6 Max Preview4/16 Werte · 3 vergleichbar | ||||||||||||||||
| Rang 56Grok 4.313/16 Werte · 12 vergleichbar | ||||||||||||||||
| Rang 57DeepSeek V4 Pro (2026-04-22)14/16 Werte · 13 vergleichbar | ||||||||||||||||
| Rang 58GPT 5.4 Mini12/16 Werte · 12 vergleichbar | ||||||||||||||||
| Rang 59Inkling15/16 Werte · 14 vergleichbar | ||||||||||||||||
| Rang 60Kimi K2.512/16 Werte · 11 vergleichbar | ||||||||||||||||
| Rang 61Qwen 3.6 Plus11/16 Werte · 11 vergleichbar | ||||||||||||||||
| Rang 62Qwen 3.7 Plus9/16 Werte · 7 vergleichbar | ||||||||||||||||
| Rang 63MiniMax M314/16 Werte · 13 vergleichbar | ||||||||||||||||
| Rang 64Claude Sonnet 4.512/16 Werte · 11 vergleichbar | ||||||||||||||||
| Rang 65Qwen 3.5 397B-A17B12/16 Werte · 6 vergleichbar | ||||||||||||||||
| Rang 66Qwen 3.6 27B13/16 Werte · 8 vergleichbar | ||||||||||||||||
| Rang 67DeepSeek V4 Flash (2026-04-22)9/16 Werte · 5 vergleichbar | ||||||||||||||||
| Rang 68GLM 59/16 Werte · 7 vergleichbar | ||||||||||||||||
| Rang 69GPT 5.4 Nano12/16 Werte · 12 vergleichbar | ||||||||||||||||
| Rang 70Gemini 2.5 Pro9/16 Werte · 7 vergleichbar | ||||||||||||||||
| Rang 71Gemini 3.5 Flash Lite12/16 Werte · 12 vergleichbar | ||||||||||||||||
| Rang 72Gemini 3.1 Flash Lite13/16 Werte · 13 vergleichbar | ||||||||||||||||
| Rang 73Claude Opus 4.17/16 Werte · 6 vergleichbar | ||||||||||||||||
| Rang 74Qwen 3.6 35B-A3B11/16 Werte · 6 vergleichbar | ||||||||||||||||
| Rang 75Gemma 4 31B IT6/16 Werte · 2 vergleichbar | ||||||||||||||||
| Rang 76Qwen 3.5 35B-A3B11/16 Werte · 6 vergleichbar | ||||||||||||||||
| Rang 77GPT 5.5 Instant5/16 Werte · 4 vergleichbar | ||||||||||||||||
| Rang 78mistral Medium 3.59/16 Werte · 8 vergleichbar | ||||||||||||||||
| Rang 79Qwen 3.5 9B8/16 Werte · 4 vergleichbar | ||||||||||||||||
| Rang 80Qwen 3 32B5/16 Werte · 4 vergleichbar | ||||||||||||||||
| Rang 81Qwen 3 14B4/16 Werte · 3 vergleichbar | ||||||||||||||||
| Rang 82GPT 4.52/16 Werte · 2 vergleichbar | ||||||||||||||||
| 18 Modelle ohne direkt vergleichbaren ECI-Wert | ||||||||||||||||
| Kein RangGemini 4 argon4/16 Werte · 3 vergleichbar | ||||||||||||||||
| Kein RangGPT 6 Sol9/16 Werte · 8 vergleichbar | ||||||||||||||||
| Kein RangGrok 4.76/16 Werte · 6 vergleichbar | ||||||||||||||||
| Kein RangGPT 6 Luna9/16 Werte · 8 vergleichbar | ||||||||||||||||
| Kein RangMiMo V2.6 Pro5/16 Werte · 4 vergleichbar | ||||||||||||||||
| Kein RangGLM 5.3 Max1/16 Werte · 1 vergleichbar | ||||||||||||||||
| Kein RangGPT 5.2 Chat Latest (2026-02-10)1/16 Werte · 1 vergleichbar | ||||||||||||||||
| Kein RangMiMo V2.5 Pro11/16 Werte · 10 vergleichbar | ||||||||||||||||
| Kein RangHY37/16 Werte · 3 vergleichbar | ||||||||||||||||
| Kein RangGrok 4.12/16 Werte · 2 vergleichbar | ||||||||||||||||
| Kein RangQwen 3.5 27B6/16 Werte · 1 vergleichbar | ||||||||||||||||
| Kein RangQwen 3.8 Flash Next7/16 Werte · 3 vergleichbar | ||||||||||||||||
| Kein RangGemma 4 12B IT4/16 Werte · 0 vergleichbar | ||||||||||||||||
| Kein RangGemma 4 26B-A4B IT4/16 Werte · 0 vergleichbar | ||||||||||||||||
| Kein RangQwen 3.8 2.4T-A95B6/16 Werte · 3 vergleichbar | ||||||||||||||||
| Kein RangMiMo V2.6 Flash5/16 Werte · 4 vergleichbar | ||||||||||||||||
| Kein RangGPT 6.1 Sol7/16 Werte · 6 vergleichbar | ||||||||||||||||
| Kein RangGemma 4 31B7/16 Werte · 3 vergleichbar | ||||||||||||||||