LLM Benchmarks

Quellenbelegte Messwerte

Vergleiche 100 KI-Modelle nach Gesamtleistung, Wissen, Coding und Agentenfähigkeiten – mit Quellen, Testdaten und nachvollziehbaren Vergleichsregeln.

Benchmarks
Modelle
Filter
Modelle
Zellenansicht
Datenqualität
Modelle vergleichen
Verfügbare Modelle: 100
100 von 100 Modellen · 16 Benchmarks
Tabelle lesen
Modell suchen · Spaltenkopf sortiert · Messwert öffnet Quelle Linie: grün ganz neu · blau aktuell · ocker ab 3 Monaten≡ Geteilter Platz: Der Vorsprung ist kleiner als eine einzige gelöste Aufgabe#3/13 Fensterplatz: gilt nur innerhalb desselben AufgabenfenstersDate Datumswort = DatumsgrundlageS·A+ Quellenvertrauen: A+ am höchsten · A stark · B solide · C eingeschränktT·Max Höchstes gemessenes Thinking16 16 Benchmarks: vier pro Bereich. Die Rubriken zeigen alle Tests ihres Bereichs.Ränge und Farben berücksichtigen alle rangfähigen Modelle je Benchmark, auch ausgeblendete. Ab zehn Ergebnissen gelten fünf Farbstufen; kleinere Gruppen bleiben neutral. Diese Ränge sind abgeleitet, keine Quellenmesswerte.ORG Benchmark-Organizer · PROV Modellanbieter · 3P Offizieller Fremdvergleich seriöse Quellen widersprechen sich beim gleichen ausgewiesenen Protokoll im selben Protokoll direkt vergleichbar, mit möglicher Benchmark-Kontamination anderes ProtokollGemessene QualitätszieleVergleichbare Zellen: 90% · Ziel ≥85%Aktuelle Kernwerte: 86% · Ziel ≥90%Kernspalten mit ≥60 Modellen: 6/16
Teilen & Export

Je Testaufbau zeigen wir die höchste dokumentierte Thinking-Stufe. Sie muss nicht den höchsten Punktwert erzielen. Die Stufen entsprechen anbieterübergreifend nicht demselben Rechenbudget.

Letzte geprüfte Aktualisierung Modelle +0/−0 · Messwerte +52 · aktualisiert 0 · −52 · 0 sichtbare Tabellenzellen geändertMaschinenlesbaren Änderungsfeed öffnen
Zellenansicht
Top 10 %Top 25 %MittelfeldUnteres ViertelSchlusslichtRänge und Farben gelten für alle Modelle je Benchmark. Modellfilter blenden nur Zeilen aus.Höchstes gemessenes Thinking
Aktuelle, quellenbelegte Ergebnisse von 100 Sprachmodellen. Die Spalten sind sortierbar. Vergleichbare Werte erhalten einen Rang; SWE-Pro kann zusätzlich klar gekennzeichnete offizielle Systemangaben sortieren, wobei abweichende Protokolle mit ≈ markiert bleiben.
GesamtWissen und ReasoningCodingAgenten und Tools
⁨ECI⁩-Rang ↓ · ModellECI, Gesamt, Epoch Capabilities Index: 82/100 gemessene Modelle; 82 vergleichbar. Kanonisches Protokoll: Epoch ECI snapshot 2026-10-01 · official-composite-fit · Epoch Capabilities Index. Beste vergleichbare zuerst.InfoAA Index, Gesamt, Artificial Analysis Intelligence Index: 58/100 gemessene Modelle; 58 vergleichbar, 1 geteilte Plätze. Kanonisches Protokoll: Artificial Analysis Intelligence Index v4.3 · intelligence-index-v4-3 · Artificial Analysis · Intelligence Index evaluations. Sortieren.InfoArena, Gesamt, Arena Text: 80/100 gemessene Modelle; 80 vergleichbar, 23 geteilte Plätze. Kanonisches Protokoll: 2026-09-30 · overall-style-control · Arena Text. Sortieren.InfoLiveBench, Gesamt, LiveBench: 55/100 gemessene Modelle; 55 vergleichbar. Kanonisches Protokoll: 2026-06-25 · overall-seven-category · LiveBench. Sortieren.InfoHLE Full, Wissen und Reasoning, Humanity's Last Exam · Full multimodal: 54/100 gemessene Modelle; 16 vergleichbar, 38 mit abweichendem Protokoll, 1 geteilte Plätze. Kanonisches Protokoll: HLE finalized 2,500 · Scale protocol 2025-04-03 · full-multimodal-2500-no-tools · Scale AI Labs · Humanity's Last Exam Full. Sortieren.InfoGPQA, Wissen und Reasoning, GPQA Diamond: 89/100 gemessene Modelle; 56 vergleichbar, 33 mit abweichendem Protokoll, 27 geteilte Plätze. Kanonisches Protokoll: GPQA Diamond v1 · Vals dual-prompt · diamond-198-zero-and-five-shot-cot · Vals AI GPQA Diamond. Sortieren.InfoMMLU-Pro, Wissen und Reasoning, MMLU-Pro: 66/100 gemessene Modelle; 57 vergleichbar, 9 mit abweichendem Protokoll, 14 geteilte Plätze. Kanonisches Protokoll: Vals MMLU-Pro v1 · vals-mmlu-pro-overall · Vals AI · MMLU-Pro. Sortieren.InfoFrontierMath T1–3, Wissen und Reasoning, FrontierMath T1–3: 64/100 gemessene Modelle; 64 vergleichbar, 16 geteilte Plätze. Kanonisches Protokoll: 2.0.0 · private-285-of-295-problem-tiers-1-3-set · Epoch AI · FrontierMath Tiers 1–3 v2. Sortieren.InfoSWE-bench, Coding, SWE-bench Verified: 60/100 gemessene Modelle; 60 vergleichbar, 18 geteilte Plätze. Kanonisches Protokoll: SWE-bench Verified v1 · verified-500-vals-mini-swe-agent · Vals AI SWE-bench Verified. Zeigt nur die einheitliche 500-Aufgaben-Auswertung von Vals AI mit mini-swe-agent und Bash. Dies ist die standardmäßige direkt vergleichbare Ansicht. Sortieren.InfoSWE-rebench, Coding, SWE-rebench v2: 38/100 gemessene Modelle; 13 vergleichbar, 8 direkt vergleichbar mit Kontaminationswarnung, 25 mit abweichendem Protokoll. Kanonisches Protokoll: rolling-v2 · 2026-05-15/2026-07-01 · SWE-rebench. Zeigt das neueste gemeinsame SWE-rebench-Aufgabenfenster. Kontaminationswarnungen bleiben sichtbar und ändern die Übereinstimmung des Zeitfensters nicht. 2026-05-15/2026-07-01 Sortieren.InfoLiveCodeBench, Coding, LiveCodeBench: 63/100 gemessene Modelle; 55 vergleichbar, 8 mit abweichendem Protokoll, 8 geteilte Plätze. Kanonisches Protokoll: Vals LiveCodeBench v1 · vals-livecodebench-overall · Vals AI · LiveCodeBench. Sortieren.InfoSciCode, Coding, SciCode: 79/100 gemessene Modelle; 70 vergleichbar, 9 mit abweichendem Protokoll, 8 geteilte Plätze. Kanonisches Protokoll: SciCode current leaderboard · scientific-research-coding-subproblems · Epoch AI mirror · SciCode. Sortieren.InfoTerminal 2.1, Agenten und Tools, Terminal-Bench 2.1: 67/100 gemessene Modelle; 58 vergleichbar, 9 mit abweichendem Protokoll, 12 geteilte Plätze. Kanonisches Protokoll: Vals Terminal-Bench 2.1 v2.1 · vals-terminal-bench-2-1-overall · Vals AI · Terminal-Bench 2.1. Sortieren.InfoMCP-Atlas, Agenten und Tools, MCP-Atlas · Scale: 24/100 gemessene Modelle; 23 vergleichbar, 1 mit abweichendem Protokoll, 2 geteilte Plätze. Kanonisches Protokoll: MCP-Atlas April 2026 rescored protocol · all-1000-public-500-private-500 · Scale AI Labs · MCP-Atlas. Sortieren.InfoAPEX, Agenten und Tools, APEX-Agents: 53/100 gemessene Modelle; 53 vergleichbar, 3 geteilte Plätze. Kanonisches Protokoll: APEX-Agents current leaderboard · 480-professional-tasks-33-worlds · Epoch AI mirror · APEX-Agents. Sortieren.InfoGDPval-AA v2.1, Agenten und Tools, GDPval-AA v2.1: 76/100 gemessene Modelle; 76 vergleichbar, 2 geteilte Plätze. Kanonisches Protokoll: GDPval-AA v2.1 (Crowd-BT Elo, DeepSeek V4.1 Flash (max) at 1600) · 220-tasks-elo-v2-1 · Artificial Analysis · Intelligence Index evaluations. Sortieren.Info
Rang 1Claude Opus 5.5Anthropic10/16 Werte · 9 vergleichbar
Rang 2GPT 6 astraOpenAI11/16 Werte · 10 vergleichbar
Rang 3Claude Sonnet 5.5Anthropic9/16 Werte · 8 vergleichbar
Rang 4Claude Fable 5.1Anthropic13/16 Werte · 12 vergleichbar
Rang 5Claude Opus 5Anthropic16/16 Werte · 15 vergleichbar
Rang 6GPT 5.5 ProOpenAI3/16 Werte · 2 vergleichbar
Rang 7Claude Fable 5Anthropic15/16 Werte · 15 vergleichbar
Rang 8GPT 5.6 SolOpenAI15/16 Werte · 15 vergleichbar
Rang 9GPT 5.6 TerraOpenAI13/16 Werte · 13 vergleichbar
Rang 10GPT 5.5OpenAI15/16 Werte · 13 vergleichbar
Rang 11GPT 5.4 ProOpenAI4/16 Werte · 3 vergleichbar
Rang 12Claude Opus 4.8Anthropic15/16 Werte · 13 vergleichbar
Rang 13Kimi K3Moonshot AI15/16 Werte · 14 vergleichbar
Rang 14Gemini 3.7 FlashGoogle13/16 Werte · 13 vergleichbar
Rang 15Gemini 3.8 FlashGoogle14/16 Werte · 14 vergleichbar
Rang 16GPT 5.4OpenAI14/16 Werte · 13 vergleichbar
Rang 17Muse Spark 1 3Meta10/16 Werte · 9 vergleichbar
Rang 18GPT 5.3 CodexOpenAI7/16 Werte · 5 vergleichbar
Rang 19Grok 4.6xAI13/16 Werte · 13 vergleichbar
Rang 20Qwen 3.8 MaxAlibaba12/16 Werte · 12 vergleichbar
Rang 21GPT 5.6 LunaOpenAI12/16 Werte · 12 vergleichbar
Rang 22Claude Opus 4.7Anthropic15/16 Werte · 14 vergleichbar
Rang 23Claude Sonnet 5Anthropic15/16 Werte · 14 vergleichbar
Rang 24GLM 5.3Z.ai14/16 Werte · 13 vergleichbar
Rang 25GPT 5.2 ProOpenAI2/16 Werte · 2 vergleichbar
Rang 26DeepSeek V4 Pro (2026-08-13)DeepSeek14/16 Werte · 13 vergleichbar
Rang 27Claude Opus 4.6Anthropic12/16 Werte · 11 vergleichbar
Rang 28Qwen 3.8 Max (0902)Alibaba6/16 Werte · 5 vergleichbar
Rang 29DeepSeek V4.1 FlashDeepSeek8/16 Werte · 7 vergleichbar
Rang 30Muse Spark 1.2Meta11/16 Werte · 10 vergleichbar
Rang 31Gemini 3.1 ProGoogle16/16 Werte · 15 vergleichbar
Rang 32DeepSeek V4 Flash (0731)DeepSeek12/16 Werte · 11 vergleichbar
Rang 33Gemini 3.5 FlashGoogle16/16 Werte · 14 vergleichbar
Rang 34Gemini 3.6 FlashGoogle13/16 Werte · 13 vergleichbar
Rang 35Muse Spark 1.1Meta13/16 Werte · 12 vergleichbar
Rang 36Grok 4.5xAI14/16 Werte · 14 vergleichbar
Rang 37Qwen 3.7 MaxAlibaba11/16 Werte · 11 vergleichbar
Rang 38GPT 5.2OpenAI11/16 Werte · 10 vergleichbar
Rang 39Gemini 3 ProGoogle10/16 Werte · 9 vergleichbar
Rang 40Claude Sonnet 4.6Anthropic15/16 Werte · 13 vergleichbar
Rang 41Muse SparkMeta9/16 Werte · 9 vergleichbar
Rang 42Grok 4.20xAI8/16 Werte · 8 vergleichbar
Rang 43GLM 5.3 FlashZ.ai14/16 Werte · 13 vergleichbar
Rang 44Gemini 3 FlashGoogle11/16 Werte · 9 vergleichbar
Rang 45GLM 5.2Z.ai744B · 40B aktiv16/16 Werte · 15 vergleichbar
Rang 46Kimi K2.6Moonshot AI1T · 32B aktiv14/16 Werte · 12 vergleichbar
Rang 47GPT 5 ProOpenAI3/16 Werte · 3 vergleichbar
Rang 48Inkling SmallThinking Machines Lab276B · 12B aktiv13/16 Werte · 12 vergleichbar
Rang 49Claude Opus 4.5Anthropic11/16 Werte · 10 vergleichbar
Rang 50Kimi K2.7 CodeMoonshot AI1T · 32B aktiv11/16 Werte · 10 vergleichbar
Rang 51GPT 5OpenAI11/16 Werte · 10 vergleichbar
Rang 52GLM 5.1Z.ai744B · 40B aktiv14/16 Werte · 12 vergleichbar
Rang 53GPT 5.1OpenAI10/16 Werte · 10 vergleichbar
Rang 54Qwen 3.8 27BAlibaba27B12/16 Werte · 11 vergleichbar
Rang 55Qwen 3.6 Max PreviewAlibaba4/16 Werte · 3 vergleichbar
Rang 56Grok 4.3xAI13/16 Werte · 12 vergleichbar
Rang 57DeepSeek V4 Pro (2026-04-22)DeepSeek1,6T · 49B aktiv14/16 Werte · 13 vergleichbar
Rang 58GPT 5.4 MiniOpenAI12/16 Werte · 12 vergleichbar
Rang 59InklingThinking Machines Lab975B · 41B aktiv15/16 Werte · 14 vergleichbar
Rang 60Kimi K2.5Moonshot AI1T · 32B aktiv12/16 Werte · 11 vergleichbar
Rang 61Qwen 3.6 PlusAlibaba11/16 Werte · 11 vergleichbar
Rang 62Qwen 3.7 PlusAlibaba9/16 Werte · 7 vergleichbar
Rang 63MiniMax M3MiniMax14/16 Werte · 13 vergleichbar
Rang 64Claude Sonnet 4.5Anthropic12/16 Werte · 11 vergleichbar
Rang 65Qwen 3.5 397B-A17BAlibaba397B · 17B aktiv12/16 Werte · 6 vergleichbar
Rang 66Qwen 3.6 27BAlibaba27B13/16 Werte · 8 vergleichbar
Rang 67DeepSeek V4 Flash (2026-04-22)DeepSeek284B · 13B aktiv9/16 Werte · 5 vergleichbar
Rang 68GLM 5Z.ai9/16 Werte · 7 vergleichbar
Rang 69GPT 5.4 NanoOpenAI12/16 Werte · 12 vergleichbar
Rang 70Gemini 2.5 ProGoogle9/16 Werte · 7 vergleichbar
Rang 71Gemini 3.5 Flash LiteGoogle12/16 Werte · 12 vergleichbar
Rang 72Gemini 3.1 Flash LiteGoogle13/16 Werte · 13 vergleichbar
Rang 73Claude Opus 4.1Anthropic7/16 Werte · 6 vergleichbar
Rang 74Qwen 3.6 35B-A3BAlibaba35B · 3B aktiv11/16 Werte · 6 vergleichbar
Rang 75Gemma 4 31B ITGoogle30,7B6/16 Werte · 2 vergleichbar
Rang 76Qwen 3.5 35B-A3BAlibaba35B · 3B aktiv11/16 Werte · 6 vergleichbar
Rang 77GPT 5.5 InstantOpenAI5/16 Werte · 4 vergleichbar
Rang 78mistral Medium 3.5Mistral AI9/16 Werte · 8 vergleichbar
Rang 79Qwen 3.5 9BAlibaba9B8/16 Werte · 4 vergleichbar
Rang 80Qwen 3 32BAlibaba32,8B5/16 Werte · 4 vergleichbar
Rang 81Qwen 3 14BAlibaba14,8B4/16 Werte · 3 vergleichbar
Rang 82GPT 4.5OpenAI2/16 Werte · 2 vergleichbar
18 Modelle ohne direkt vergleichbaren ECI-Wert
Kein RangGemini 4 argonGoogle4/16 Werte · 3 vergleichbar
Kein RangGPT 6 SolOpenAI9/16 Werte · 8 vergleichbar
Kein RangGrok 4.7xAI6/16 Werte · 6 vergleichbar
Kein RangGPT 6 LunaOpenAI9/16 Werte · 8 vergleichbar
Kein RangMiMo V2.6 ProXiaomi5/16 Werte · 4 vergleichbar
Kein RangGLM 5.3 MaxZ.ai1/16 Werte · 1 vergleichbar
Kein RangGPT 5.2 Chat Latest (2026-02-10)OpenAI1/16 Werte · 1 vergleichbar
Kein RangMiMo V2.5 ProXiaomi11/16 Werte · 10 vergleichbar
Kein RangHY3Tencent7/16 Werte · 3 vergleichbar
Kein RangGrok 4.1xAI2/16 Werte · 2 vergleichbar
Kein RangQwen 3.5 27BAlibaba27B6/16 Werte · 1 vergleichbar
Kein RangQwen 3.8 Flash NextAlibaba125B · 6B aktiv7/16 Werte · 3 vergleichbar
Kein RangGemma 4 12B ITGoogle12B4/16 Werte · 0 vergleichbar
Kein RangGemma 4 26B-A4B ITGoogle25,2B · 3,8B aktiv4/16 Werte · 0 vergleichbar
Kein RangQwen 3.8 2.4T-A95BAlibaba2,4T · 95B aktiv6/16 Werte · 3 vergleichbar
Kein RangMiMo V2.6 FlashXiaomi5/16 Werte · 4 vergleichbar
Kein RangGPT 6.1 SolOpenAI7/16 Werte · 6 vergleichbar
Kein RangGemma 4 31BGoogle7/16 Werte · 3 vergleichbar