LLM Benchmarks

Quellenbelegte Messwerte

Wissen & Methodik

Benchmarks verstehen, Messwerte fair vergleichen und die Quellen hinter LLM Benchmarks nachvollziehen. Mit Methodik, Benchmark-Lesehilfe und datenbasierten Analysen.

Wie kommen die Werte zustande?

Ein Score ist erst dann hilfreich, wenn klar ist, welches Modell unter welchen Bedingungen getestet wurde. Hier erklären wir, wie wir veröffentlichte Ergebnisse auswählen, prüfen und in der Tabelle einordnen.

Unsere eigene Leistung ist die Zusammenführung und Prüfung der Belege. Die verlinkten Benchmark-Betreiber und Modellanbieter führen die zugrunde liegenden Tests durch.

1. Welche Modelle und Quellen erscheinen?

Die Auswahl verbindet Modelle aus dem Epoch Capabilities Index mit weiteren anspruchsvollen Tests, geprüften neuen Herstellerveröffentlichungen und einem eigenen Kontingent offener Modelle. So werden auch kleinere Checkpoints berücksichtigt, die auf großen Ranglisten wenig vertreten sind. Die Auswahl bildet einen Ausschnitt des Marktes ab und ist kein vollständiges Modellverzeichnis.

Wir verwenden Ergebnisse von Benchmark-Betreibern, unabhängigen Evaluatoren und belegten Herstellerberichten. Modellidentität, Quelle, Testversion und Veröffentlichungsbedingungen müssen nachvollziehbar sein. Ein öffentlich erreichbarer Wert wird nicht automatisch zur Veröffentlichung freigegeben. Herstellerangaben bleiben als solche erkennbar.

2. Wann sind zwei Werte vergleichbar?

Der Benchmark-Name allein reicht nicht. Wir berücksichtigen Release, Version, Aufgabenfenster, Metrik, Einheit, Werkzeuge, Agentenaufbau und Bewertungsverfahren. Für jeden Benchmark ist eine Vergleichsspur definiert. Werte aus abweichenden Aufbauten können zusätzliche Information liefern, erhalten aber nicht stillschweigend denselben Rangstatus.

  • Rang: Einordnung innerhalb des jeweiligen zulässigen Benchmark-Protokolls; kein Gesamturteil über das Modell.
  • ≈: ergänzender Wert mit abweichenden Bedingungen. Erst die Messdetails prüfen.
  • Konflikt: glaubwürdige Quellen widersprechen sich beim gleichen dokumentierten Aufbau. Kein belastbarer Einzelrang.
  • Leere Zelle: kein passender sichtbarer Messwert. Sie bedeutet weder null Punkte noch eine gescheiterte Evaluation.

3. Welche Thinking-Stufe wird gewählt?

Innerhalb derselben Quelle und Testreihe bevorzugen wir die höchste dokumentierte feste Stufe: max, xhigh, high, medium, low, minimal, off. Dabei wird nicht nachträglich der höchste Punktwert herausgesucht. Ein gültiger Max-Lauf kann deshalb einen niedrigeren Score zeigen als High. Andere Agenten, Testversionen oder Aufgabenfenster werden nicht wegen einer höheren Stufe vermischt.

Adaptiv bedeutet, dass Thinking eingeschaltet ist, aber kein festes Max-Budget belegt ist. Unbekannte Einstellungen bleiben unbekannt. Auch zwei Anbieterbezeichnungen „High“ stehen nicht automatisch für denselben Rechenaufwand.

4. Was bedeuten Datum und Quellenvertrauen?

Testdatum, Veröffentlichung, Datensatzversion und erster beobachteter Wert sind unterschiedliche Ereignisse. Wenn eine Quelle kein Datum für einen einzelnen Test nennt, verwenden wir gegebenenfalls den Zeitpunkt, an dem dieser exakte Wert erstmals erfasst wurde. Das beweist kein neues Testdatum. Die Messdetails nennen die jeweilige Datumsgrundlage.

Quellenvertrauen und Belegqualität werden getrennt bewertet. Die Stufen A+, A, B und C sind unsere Ordnung der Quellen und Belege; sie sind keine statistische Wahrscheinlichkeit, dass eine Zahl stimmt. Ein hoher Quellenrang hebt abweichende Testbedingungen nicht auf.

5. Was die Tabelle nicht belegt

Kleine Punktabstände sind ohne passende Unsicherheitsanalyse kein nachgewiesener Leistungsvorsprung. Prozentpunkte sind keine relative Prozentverbesserung. Ein aggregierter Index misst außerdem etwas anderes als die Erfolgsquote bei einer konkreten Aufgabe; wir mitteln die verschiedenen Spalten nicht zu einem eigenen Gesamtscore.

Quantisierung und Hardware bleiben ergänzende Studien. Unterschiedliche Backends, GPUs oder Aufgabenteilmengen verhindern eine Aussage über den Einfluss der Quantisierung allein. Gewichtsdateigröße, GPU-Kapazität und gemessener Speicherverbrauch sind unterschiedliche Angaben. Die publizierten Hardwaretests sind keine eigenen Labormessungen von LLM Benchmarks.

6. Belege prüfen und Fehler melden

Öffne einen Tabellenwert, um Quelle, Testaufbau, Datum und verfügbare Thinking-Varianten zu prüfen. Die Daten lassen sich als CSV und JSON herunterladen. Bei einem Fehler helfen uns Modellname, Benchmark, betroffener Wert und ein Link zum Originalbeleg. Geänderte Quellen werden erneut gegen die Veröffentlichungsregeln geprüft; ein bestätigter Fehler wird im Datenbestand korrigiert.

Was misst welcher Benchmark?

Die passende Kennzahl hängt von deiner Aufgabe ab. Ein breiter Fähigkeitsindex, eine Wissensprüfung und ein Coding-Agent testen verschiedene Dinge. Diese Lesehilfe zeigt, welche Schlüsse jeweils sinnvoll sind.

Beginne mit deiner Aufgabe, prüfe anschließend das Testprotokoll und vergleiche erst dann die Punktwerte.

Gesamtbild: ECI und zusammengesetzte Indizes

Der Epoch Capabilities Index bündelt Ergebnisse verschiedener Tests auf einer gemeinsamen Fähigkeitsskala. Er hilft bei einer ersten Einordnung über mehrere Aufgabenbereiche. Sein Wert ist kein Prozentsatz gelöster Aufgaben. Mit neuen Daten können sich auch Schätzwerte für unveränderte Modelle verschieben.

Unsere Einordnung: Nutze einen Index für eine Vorauswahl und prüfe anschließend die für dich relevanten Einzeltests. Ein spezialisierter Assistent kann für deinen Einsatz passen, obwohl sein breiter Indexwert niedriger liegt. Werte verschiedener Indizes darfst du nicht direkt voneinander abziehen.

Wissen und Schlussfolgern: GPQA, HLE und Mathematik

GPQA umfasst anspruchsvolle, von Fachleuten erstellte Fragen aus Biologie, Physik und Chemie. In der Tabelle ist das Diamond-Teilset maßgeblich. Solche Tests geben Hinweise auf fachliches Problemlösen unter dem jeweiligen Prüfaufbau. Sie messen nicht automatisch die Zuverlässigkeit eines Assistenten bei offenen Recherchefragen.

Bei HLE bleiben Text und vollständiger Aufgabenbestand getrennt. Werkzeugzugriff kann die Aufgabe verändern. Bei Mathematiktests ist die Aufgabenschwierigkeit entscheidend: Ein guter Wert auf einem älteren oder leichteren Set ersetzt keinen Beleg für neuere schwere Aufgaben. Für eine Wissensanwendung würden wir zusätzlich eigene Fragen mit prüfbaren Quellen testen.

Coding: Einzelaufgabe oder vollständiger Agent?

Ein Coding-Test kann eine abgegrenzte Programmieraufgabe bewerten oder einen Agenten durch ein bestehendes Repository arbeiten lassen. SWE-bench untersucht die Bearbeitung realer Softwareprobleme. Dabei beeinflussen auch Werkzeuge, Agentensteuerung und Testumgebung das Ergebnis.

Unsere Einordnung: Wer einen Coding-Agenten auswählt, sollte einen belegten Systemaufbau vergleichen. Für einzelne Codefunktionen kann ein engerer Coding-Test passender sein. Verified, Pro und wechselnde Rebench-Aufgabenfenster sind keine austauschbaren Messlatten. Ein Erfolg auf einem Set ist keine Erfolgsprognose für dein Repository.

Agenten und Werkzeuge: Der Ablauf gehört zum Test

Bei Terminal-, Werkzeug- und mehrstufigen Agententests muss ein Modell innerhalb einer vorgegebenen Umgebung handeln. Verfügbare APIs, Agentenaufbau, Zeit- und Aufruflimits gehören damit zur Bedeutung des Scores. In unserer Tabelle bleiben beispielsweise die beiden Banking-Testaufbauten getrennt.

Unsere Einordnung: Ein solcher Wert ist besonders dann nützlich, wenn der Test deinem Ablauf ähnelt. Für einen Produktiveinsatz fehlen sonst entscheidende Aspekte wie Berechtigungen, Wiederherstellung nach Fehlern und deine eigenen Erfolgskriterien. Prüfe deshalb die Messdetails und teste eine kleine Auswahl typischer eigener Abläufe.

Anweisungen und Präferenzen richtig lesen

IFEval prüft objektiv überprüfbare Anweisungen, etwa geforderte Ausgabeformen. Das ist hilfreich, wenn dein Ablauf auf die Einhaltung konkreter Vorgaben angewiesen ist. Es belegt weder umfassende Faktentreue noch die fachliche Qualität jeder Antwort.

Arena-Ranglisten spiegeln Präferenzen im jeweiligen Vergleichsverfahren wider. Eine bevorzugte Antwort ist nicht zwangsläufig fachlich korrekt. Unsere Einordnung: Für Schreibstil kann eine Präferenzmessung relevant sein; für überprüfbare Richtigkeit braucht es zusätzlich eine fachliche Prüfung.

Alle Benchmarks der Vergleichstabelle

Das folgende Verzeichnis verlinkt die Originalseiten und nennt die bei uns verwendete Vergleichsspur. Deren Versions- und Aufgabenangaben sind wichtiger als ein ähnlich klingender Benchmark-Name. Die Gruppierung dient der Orientierung; sie ist keine Gewichtung für einen Gesamtrang.

Gesamt

Epoch Capabilities Index

Von Epoch AI aus mehr als 50 Benchmarks abgeleiteter zusammengesetzter Fähigkeitsindex.

Vergleichsquelle
Epoch Capabilities Index
Version / Aufgaben
Epoch ECI snapshot 2026-10-01 · official-composite-fit
Metrik / Einheit
eci · index_points
Zur Originalseite ↗
Artificial Analysis Intelligence Index

Zusammengesetzter Intelligence Index von Artificial Analysis; ein Wert je Modell und Reasoning-Einstellung. Das Protokoll nennt die Version der Bewertungsmethode.

Vergleichsquelle
Artificial Analysis · Intelligence Index evaluations
Version / Aufgaben
Artificial Analysis Intelligence Index v4.3 · intelligence-index-v4-3
Metrik / Einheit
index_score · points
Zur Originalseite ↗
Arena Text

Rangliste für Textmodelle nach menschlichen Präferenzen.

Vergleichsquelle
Arena Text
Version / Aufgaben
2026-09-30 · overall-style-control
Metrik / Einheit
arena_score · points
Zur Originalseite ↗
LiveBench

Häufig aktualisierte objektive Evaluation über ein breites Fähigkeitsspektrum.

Vergleichsquelle
LiveBench
Version / Aufgaben
2026-06-25 · overall-seven-category
Metrik / Einheit
category_balanced_average · percent
Zur Originalseite ↗

Wissen und Reasoning

Humanity's Last Exam · Full multimodal

Vergleichbare Werte nutzen das vollständige multimodale 2.500-Fragen-Protokoll ohne Tools; Text- und Tool-Läufe bleiben getrennt.

Vergleichsquelle
Scale AI Labs · Humanity's Last Exam Full
Version / Aufgaben
HLE finalized 2,500 · Scale protocol 2025-04-03 · full-multimodal-2500-no-tools
Metrik / Einheit
accuracy · percent
Zur Originalseite ↗
Humanity's Last Exam · Text-only

Textmenge von Artificial Analysis: 2.158 der 2.500 Fragen, ohne Tools. Eine andere Fragenmenge, keine schwächere Messung des vollen Protokolls.

Vergleichsquelle
Artificial Analysis · Intelligence Index evaluations
Version / Aufgaben
HLE text-only (Artificial Analysis) · text-only-2158-no-tools
Metrik / Einheit
accuracy · percent
Zur Originalseite ↗
SimpleQA Verified

Faktenwissen bei Kurzantworten und Qualität des Enthaltens.

Vergleichsquelle
Epoch AI SimpleQA Verified
Version / Aufgaben
Epoch independent Inspect runs · verified-1000-epoch-inspect
Metrik / Einheit
accuracy · percent
Zur Originalseite ↗
GPQA Diamond

Naturwissenschaftliche Fragen auf Hochschulniveau aus Physik, Chemie und Biologie.

Vergleichsquelle
Vals AI GPQA Diamond
Version / Aufgaben
GPQA Diamond v1 · Vals dual-prompt · diamond-198-zero-and-five-shot-cot
Metrik / Einheit
accuracy · percent
Zur Originalseite ↗
MMLU-Pro

Broad academic multiple-choice knowledge and reasoning across fourteen subjects; Vals AI's independent run over the MMLU-Pro set.

Vergleichsquelle
Vals AI · MMLU-Pro
Version / Aufgaben
Vals MMLU-Pro v1 · vals-mmlu-pro-overall
Metrik / Einheit
accuracy · percent
Zur Originalseite ↗
FrontierMath T1–3

Unabhängige Epoch-AI-Läufe über 295 von Experten erstellte Aufgaben höherer Mathematik; Tier 4 bleibt getrennt.

Vergleichsquelle
Epoch AI · FrontierMath Tiers 1–3 v2
Version / Aufgaben
2.0.0 · private-285-of-295-problem-tiers-1-3-set
Metrik / Einheit
mean_score · percent
Zur Originalseite ↗
ARC-AGI-2

Abstrakte Regelinduktion über 360 Evaluationsaufgaben; pass@2-Varianten bleiben nach Thinking-Stufe getrennt.

Vergleichsquelle
ARC-AGI-2
Version / Aufgaben
v2 · semi-private-120
Metrik / Einheit
accuracy · percent
Zur Originalseite ↗
FrontierMath T4

Independent Epoch AI runs on the 41 private research-level problems from the 43-problem FrontierMath Tier 4 v2 set; the two public examples and Tiers 1–3 are not mixed into this column.

Vergleichsquelle
Epoch AI · FrontierMath Tier 4 v2
Version / Aufgaben
2.0.0 · private-41-of-43-problem-tier-4-set
Metrik / Einheit
mean_score · percent
Zur Originalseite ↗
MMMU-Pro

Multimodales Expertenwissen und Reasoning.

Vergleichsquelle
Vals AI · MMMU-Pro
Version / Aufgaben
Vals MMMU-Pro v1 · vals-mmmu-pro-overall
Metrik / Einheit
accuracy · percent
Zur Originalseite ↗
CritPt

Physik-Forschungsaufgaben: 71 offene Herausforderungen, automatisch bewertet.

Vergleichsquelle
Artificial Analysis · Intelligence Index evaluations
Version / Aufgaben
CritPt (Artificial Analysis) · 70-challenges-official-grading
Metrik / Einheit
accuracy · percent
Zur Originalseite ↗
SimpleBench

Alltagslogik mit Fangfragen, bei denen Menschen Spitzenmodelle noch schlagen; Mittel aus fünf Läufen.

Vergleichsquelle
Epoch AI mirror · SimpleBench
Version / Aufgaben
SimpleBench current leaderboard · official-set-avg-at-5
Metrik / Einheit
accuracy_avg_at_5 · percent
Zur Originalseite ↗
Chess Puzzles

100 enginegenerierte Schachrätsel von Epoch AI mit genau einem besten Zug; von Epoch datiert ausgeführt.

Vergleichsquelle
Epoch AI · Chess Puzzles
Version / Aufgaben
Epoch AI Chess Puzzles v1 · 100-engine-generated-single-best-move-puzzles
Metrik / Einheit
mean_score · percent
Zur Originalseite ↗
ARC-AGI-1

Ursprüngliche ARC-AGI-Abstraktionsrätsel auf dem semi-privaten Set laut ARC Prize.

Vergleichsquelle
Epoch AI mirror · ARC-AGI-1
Version / Aufgaben
ARC-AGI-1 current leaderboard · semi-private-evaluation-pass-at-2
Metrik / Einheit
pass_at_2_accuracy · percent
Zur Originalseite ↗
IFEval

Instruction following. Provider reports and subset studies retain their scoring and sample-set labels; they do not form a uniform cross-model ranking.

Ergänzende Ergebnisse; keine gemeinsame kanonische Vergleichsspur ausgewiesen.

Zur Originalseite ↗
IFBench

Genaues Befolgen von Anweisungen: 300 Prompts mit 344 prüfbaren Vorgaben, strikte Trefferquote je Anweisung nach dem Swallow LLM Leaderboard.

Vergleichsquelle
Swallow LLM Leaderboard
Version / Aufgaben
swallow-evaluation-instruct · ifbench-test-300-prompts-344-instructions
Metrik / Einheit
inst_level_strict_acc · percent
Zur Originalseite ↗

Coding

SWE-bench Verified

Lösungsrate bei 500 verifizierten realen Softwareproblemen; der Primärvergleich nutzt einen einheitlichen minimalen Agent-Harness.

Vergleichsquelle
Vals AI SWE-bench Verified
Version / Aufgaben
SWE-bench Verified v1 · verified-500-vals-mini-swe-agent
Metrik / Einheit
resolved_rate · percent
Zur Originalseite ↗
SWE-rebench v2

Aktuelle, zeitfensterbasierte Lösung realer Softwareprobleme.

Vergleichsquelle
SWE-rebench
Version / Aufgaben
rolling-v2 · 2026-05-15/2026-07-01
Metrik / Einheit
resolved_rate · percent
Zur Originalseite ↗
SWE-bench-Live · Lite

Laufend aktualisierte Lösung realer Softwareprobleme; Agent, Modell und gemeldete Thinking-Stufe bleiben verbunden.

Vergleichsquelle
SWE-bench-Live · Lite
Version / Aufgaben
SWE-bench-Live Lite · lite-300-python
Metrik / Einheit
resolved_rate · percent
Zur Originalseite ↗
DeepSWE

Neue, langwierige Software-Engineering-Aufgaben mit getrennten Ergebnissen nach Harness und Thinking-Stufe.

Vergleichsquelle
DeepSWE official live leaderboard
Version / Aufgaben
DeepSWE v1.1 live leaderboard · 113-original-long-horizon-tasks
Metrik / Einheit
pass_at_1 · percent
Zur Originalseite ↗
SWE-bench Pro Public · Scale

Scale AI Labs' separate 731-task professional software-engineering benchmark. Results keep the submitted model, agent label, confidence interval and row-specific publication date; they are never mixed with SWE-bench Verified, SWE-rebench or vendor supplemental protocols. A July 2026 OpenAI audit reported substantial task-quality concerns, so SWE-Pro should be read as one imperfect signal rather than an absolute model ranking.

Vergleichsquelle
Scale AI Labs · SWE-bench Pro Public
Version / Aufgaben
Scale public 731-task leaderboard · public-731
Metrik / Einheit
resolved_rate · percent
Zur Originalseite ↗
CursorBench

Coding-Agenten-Evaluation mit expliziten Thinking-Stufen sowie Kosten-, Token- und Schrittmetadaten.

Vergleichsquelle
Epoch AI mirror · CursorBench
Version / Aufgaben
CursorBench current leaderboard · official-current-suite
Metrik / Einheit
score · percent
Zur Originalseite ↗
FrontierCode 1.1 · Main

Schwere Coding-Aufgaben mit Fokus auf Mergebarkeit; Harness und Thinking-Stufe bleiben am Messwert.

Vergleichsquelle
Epoch AI mirror · FrontierCode 1.1
Version / Aufgaben
FrontierCode 1.1 · main-100-hardest-tasks
Metrik / Einheit
mergeability_rubric_mean_at_5 · percent
Zur Originalseite ↗
IOI

IOI-Olympiadeaufgaben 2024 und 2025, von Vals AI mit Olympiade-Bewertern ausgewertet.

Vergleichsquelle
Vals AI · IOI
Version / Aufgaben
Vals IOI v2 · vals-ioi-2024-2026-overall
Metrik / Einheit
score · percent
Zur Originalseite ↗
LiveCodeBench

Wettbewerbs-Programmieraufgaben nach dem Trainingsstichtag; unabhängige Vals-AI-Implementierung, pass@1 gesamt.

Vergleichsquelle
Vals AI · LiveCodeBench
Version / Aufgaben
Vals LiveCodeBench v1 · vals-livecodebench-overall
Metrik / Einheit
pass_at_1 · percent
Zur Originalseite ↗
SciCode

Wissenschaftliches Programmieren, gemessen als Teilaufgaben-Genauigkeit mit ausführbaren Python-Tests.

Vergleichsquelle
Epoch AI mirror · SciCode
Version / Aufgaben
SciCode current leaderboard · scientific-research-coding-subproblems
Metrik / Einheit
subproblem_accuracy · percent
Zur Originalseite ↗
ALE-Bench

Punktbasierte algorithmische Optimierungswettbewerbe (AtCoder Heuristic); Performance-Rating.

Vergleichsquelle
Epoch AI mirror · ALE-Bench
Version / Aufgaben
ALE-Bench current leaderboard · atcoder-heuristic-contest-set
Metrik / Einheit
performance_rating · points
Zur Originalseite ↗
Vibe Code Bench

Vollständige Webanwendungen von Grund auf in einem Agenten-Harness, ausgewertet von Vals AI.

Vergleichsquelle
Vals AI · Vibe Code Bench
Version / Aufgaben
Vals Vibe Code Bench v1.1 · vals-vibe-code-bench-overall
Metrik / Einheit
score · percent
Zur Originalseite ↗
Text Arena · Coding

Menschliche Präferenzwertung für erzeugte Webanwendungen mit React und TypeScript.

Vergleichsquelle
Epoch AI mirror · Text Arena (Coding)
Version / Aufgaben
Text Arena Coding current pool · text-arena-coding-bradley-terry
Metrik / Einheit
bradley_terry_rating · points
Zur Originalseite ↗
WeirdML

Ungewöhnliche Machine-Learning-Aufgaben, die Modelle durch Schreiben und Ausführen von Code lösen.

Vergleichsquelle
Epoch AI mirror · WeirdML
Version / Aufgaben
WeirdML v2 current leaderboard · weirdml-v2-task-set
Metrik / Einheit
accuracy · percent
Zur Originalseite ↗

Agenten und Tools

Terminal-Bench 2.0

Terminal-Bench-2.0-Rangliste über 89 schwere Terminal-Aufgaben; Agent-Harness und Laufdatum bleiben am Score.

Vergleichsquelle
Epoch AI mirror · Terminal-Bench 2.0
Version / Aufgaben
Terminal-Bench 2.0 · official-89-task-set
Metrik / Einheit
accuracy_mean · percent
Zur Originalseite ↗
Terminal-Bench 2.1

Unabhängiger Terminal-Bench-2.1-Lauf von Vals AI mit einheitlichem Harness; Herstellerberichte bleiben ergänzend.

Vergleichsquelle
Vals AI · Terminal-Bench 2.1
Version / Aufgaben
Vals Terminal-Bench 2.1 v2.1 · vals-terminal-bench-2-1-overall
Metrik / Einheit
accuracy · percent
Zur Originalseite ↗
Terminal-Bench 3.0

Offizielle Agent-plus-Modell-Rangliste über 74 schwere Terminal-Aufgaben; Agent, Aufwand und Versuchszahl bleiben am Score erhalten.

Vergleichsquelle
Terminal-Bench 3.0
Version / Aufgaben
3.0 · b936386b-4afd-4ad7-aa7f-6b52bcab9853 · official-74-task-leaderboard
Metrik / Einheit
accuracy · percent
Zur Originalseite ↗
τ³-Banking · Official harness

Wissensintensive mehrstufige Banking-Support-Aufgaben mit Retrieval, Tools und simuliertem Nutzer, wie auf der offiziellen Rangliste veröffentlicht.

Vergleichsquelle
τ³-Banking
Version / Aufgaben
1.0.1 · banking_knowledge
Metrik / Einheit
pass_1 · percent
Zur Originalseite ↗
τ³-Banking · Artificial Analysis harness

Eigener Lauf von Artificial Analysis über dieselbe Domäne: 97 Aufgaben, BM25/grep-Retrieval und ein anderer Nutzersimulator. Der Simulator gehört zur Messung, deshalb eine eigene Spalte und keine Zweitmeinung.

Vergleichsquelle
Artificial Analysis · Intelligence Index evaluations
Version / Aufgaben
τ³-Banking (Artificial Analysis) · banking-97-tasks-gpt-5-4-mini-simulator
Metrik / Einheit
pass_at_1 · percent
Zur Originalseite ↗
MCP-Atlas · Scale

Real-world multi-step tool use across 1,000 tasks, 36 MCP servers and 220 tools. The comparable lane uses Scale's April 2026 rescored protocol, all public and private tasks, a 100-tool-call budget and the exact row-specific publication date.

Vergleichsquelle
Scale AI Labs · MCP-Atlas
Version / Aufgaben
MCP-Atlas April 2026 rescored protocol · all-1000-public-500-private-500
Metrik / Einheit
pass_rate · percent
Zur Originalseite ↗
SkillsBench v1.1

Auditierter Agentenbenchmark über 87 professionelle Aufgaben; Läufe mit und ohne bereitgestellte Skills bleiben getrennt.

Vergleichsquelle
SkillsBench v1.1
Version / Aufgaben
v1.1 · official-87-tasks-with-skills
Metrik / Einheit
pass_rate · percent
Zur Originalseite ↗
APEX-Agents

Langwierige professionelle Aufgaben aus Banking, Beratung und Recht mit Office-Tools und Codeausführung.

Vergleichsquelle
Epoch AI mirror · APEX-Agents
Version / Aufgaben
APEX-Agents current leaderboard · 480-professional-tasks-33-worlds
Metrik / Einheit
pass_at_1 · percent
Zur Originalseite ↗
Berkeley Function Calling Leaderboard V4

Function Calling, mehrstufige Tool-Nutzung und Halluzinationsresistenz im offiziellen BFCL-V4-Test.

Vergleichsquelle
BFCL V4
Version / Aufgaben
v4-ede5081a24bc · overall
Metrik / Einheit
overall_accuracy · percent
Zur Originalseite ↗
LMArena Agent Arena

Human preference evaluation of agent outcomes. Every score retains the submitted model, disclosed thinking label, confidence interval and observation count.

Vergleichsquelle
LMArena Agent Arena
Version / Aufgaben
2026-09-30 · overall-ips-aggregate
Metrik / Einheit
ips_score · ips
Zur Originalseite ↗
AppWorld

Interactive coding-agent benchmark across controllable applications and APIs; model, method, scaffold and task/scenario metrics remain attached to each run.

Vergleichsquelle
AppWorld official leaderboard
Version / Aufgaben
official-c1f56015cf7c · test-challenge-all
Metrik / Einheit
task_goal_completion · percent
Zur Originalseite ↗
Vending-Bench 2

Langzeit-Geschäftssimulation: mittlerer Endsaldo in USD nach einem simulierten Jahr.

Vergleichsquelle
Epoch AI mirror · Vending-Bench 2
Version / Aufgaben
Vending-Bench 2 current leaderboard · one-simulated-year-mean-final-balance
Metrik / Einheit
mean_final_balance_usd · USD
Zur Originalseite ↗
GDPval-AA v2.1

Nachfolger von GDPval-AA v2: dieselben 220 Aufgaben und Prüfer, das Elo neu angepasst und an DeepSeek V4.1 Flash (max) bei 1600 festgemacht – nicht mit v2-Werten vergleichbar.

Vergleichsquelle
Artificial Analysis · Intelligence Index evaluations
Version / Aufgaben
GDPval-AA v2.1 (Crowd-BT Elo, DeepSeek V4.1 Flash (max) at 1600) · 220-tasks-elo-v2-1
Metrik / Einheit
elo · points
Zur Originalseite ↗

Was sagen die Daten wirklich aus?

Wir untersuchen nicht nur, welches Modell mehr Punkte hat. Diese Analysen zeigen, wo die Belege einen Vergleich tragen, wo Messungen fehlen und welche Schlussfolgerungen zu weit gehen würden.

Die Kennzahlen werden aus demselben Datenstand wie die Vergleichstabelle berechnet. Die fachliche Einordnung ist von LLM Benchmarks; die Messungen stammen aus den jeweils genannten Quellen.

Was diese Auswertungen leisten

Die Auswahl der Modelle und die Verfügbarkeit veröffentlichter Tests prägen jede Auswertung. Mehr Belege bedeuten zunächst mehr überprüfbare Information, nicht automatisch ein besseres Modell. Wir nennen deshalb jeweils Zähleinheit, Datenstand und Grenzen. Die Berichte werden mit dem veröffentlichten Datenbestand neu berechnet und sind keine unabhängigen Nachmessungen.

Konkrete Modellvergleiche und Fallbeispiele lesen →

01

Kleine offene Modelle: Wie belastbar ist der Vergleich?

Wer ein kleines offenes Modell sucht, braucht mehr als einen einzelnen guten Score. Wir prüfen für die erfassten offenen Modelle unter 36 Milliarden Gesamtparametern, wie viele Benchmark-Paare überhaupt belegt sind und wo direkt vergleichbare Belege vorliegen.

Breite Messabdeckung erleichtert die Vorauswahl. Sie ist ein Maß für die verfügbare Evidenz, kein Qualitätsrang und keine Aussage über den Speicherbedarf.

Wie dicht ist die Datenlage?

Ein Paar besteht aus genau einem Modell und einem Benchmark der vollständigen Vergleichstabelle. Mehrere Thinking-Stufen zählen zusammen nur einmal; Quantisierungsstudien zählen nicht als Beleg des Basismodells. „Vergleichbar“ bedeutet, dass mindestens ein konfliktfreier Beleg mit dem Vergleichsstatus der Tabelle vorhanden ist. Es werden alle erfassten Basismodell-Konfigurationen berücksichtigt, nicht nur die gerade sichtbare Filteransicht.

11erfasste Modelle
171 / 506belegte Modell-Benchmark-Paare
100davon mit vergleichbarem Beleg
Messabdeckung nach Aufgabenbereich

Jeder Balken umfasst alle möglichen Paare seiner Rubrik. Zahlen: vergleichbar / belegt / möglich.

Gesamt19 / 19 / 44
Wissen und Reasoning34 / 71 / 165
Coding27 / 46 / 154
Agenten und Tools20 / 35 / 143
Vergleichbarer BelegNur weitere BelegeKein erfasster Beleg

Eigene Zählung aus dem öffentlichen Datenexport. Datenstand: . JSON · CSV

Was folgt daraus für die Modellauswahl?

Suche zuerst Belege für deinen Aufgabenbereich. Viele Wissensmessungen schließen eine Lücke bei Coding-Agenten nicht. Vergleiche anschließend nur die gemeinsam gemessenen Benchmarks deiner Kandidaten und prüfe dort das Protokoll. Eine unbekannte Gesamtgröße wird nicht aus dem Modellnamen geraten und führt nicht zur Aufnahme in diese Unter-36B-Auswertung.

Die hellen Bereiche der Grafik sind offene Informationslücken in unserem Bestand. Ein Modell kann anderswo getestet worden sein, ohne dass wir einen veröffentlichbaren Beleg erfasst haben. Die Auswahl der Modelle ist zudem kuratiert. Deshalb lässt sich aus den Balken kein allgemeiner Vorsprung offener oder geschlossener Modelle ableiten.

So lässt sich die Auswertung nachvollziehen

Im JSON-Export: offene Modelle mit belegter Gesamtparameterzahl größer null und kleiner 36 Milliarden auswählen. Nur Benchmarks der Website berücksichtigen. Je Modell und Benchmark Basismodell-Belege zusammenfassen; Varianten mit Quantisierung getrennt halten. Die Datenbasis umfasst auch ältere noch veröffentlichte Werte. Für eine aktuelle Kauf- oder Einsatzentscheidung ist das jeweilige Messdatum zusätzlich zu prüfen.

02

Gleicher Benchmark, andere Bedingungen

Zwei veröffentlichte Zahlen können beide richtig sein und trotzdem keinen fairen Abstand ergeben. Wir zählen, für wie viele Modell-Benchmark-Paare überhaupt vergleichbare Belege vorliegen, und erklären den Unterschied anhand unserer Testspuren.

Gemeinsam gemessen bedeutet nicht automatisch direkt vergleichbar. Vor jeder Differenz müssen Version, Aufgaben und Testaufbau zusammenpassen.

Belegt ist nicht immer vergleichbar

Die Auswertung zählt Paare aus allen ausgewählten Modellen und Benchmarks der Website. Sobald mindestens ein Basismodell-Beleg vorhanden ist, zählt das Paar als belegt. Vergleichbare Paare benötigen zusätzlich mindestens einen konfliktfreien Beleg mit dem entsprechenden Tabellenstatus. Der Rest enthält nur ergänzende oder anderweitig nicht direkt vergleichbare Belege. Thinking-Varianten werden nicht mehrfach gezählt.

100erfasste Modelle
2.221 / 4.600belegte Modell-Benchmark-Paare
1.991davon mit vergleichbarem Beleg
Messabdeckung nach Aufgabenbereich

Jeder Balken umfasst alle möglichen Paare seiner Rubrik. Zahlen: vergleichbar / belegt / möglich.

Gesamt275 / 275 / 400
Wissen und Reasoning705 / 816 / 1.500
Coding589 / 683 / 1.400
Agenten und Tools422 / 447 / 1.300
Vergleichbarer BelegNur weitere BelegeKein erfasster Beleg

Eigene Zählung aus dem öffentlichen Datenexport. Datenstand: . JSON · CSV

Drei Situationen, in denen ein Abstand täuscht

SWE-bench: Ein Modell in einem Hersteller-Agenten und ein anderes in einem einheitlichen Evaluationsaufbau sind zunächst zwei Systeme. Unser strenger Verified-Vergleich verwendet die definierte Vals-Spur. Bei Pro bleiben berichtete Systemwerte von der unmittelbar vergleichbaren Spur getrennt.

HLE: Ein vollständiger Aufgabenbestand und ein Text-Teilset haben unterschiedliche Nenner. Werkzeugnutzung verändert zusätzlich die erlaubten Lösungswege. Ein Prozentpunktabstand zwischen diesen Aufbauten wäre keine isolierte Modellverbesserung.

SWE-rebench: Wechselnde Aufgabenfenster verändern, welche Probleme gelöst werden müssen. Ein älteres belegtes Fenster kann eine eigene Vergleichsgruppe bilden. Seine Rangnummer gehört dann zu diesem Fenster und darf nicht mit dem aktuellen Fenster gleichgesetzt werden.

Ein belastbarer Vergleich in drei Schritten

Wähle zwei bis vier Modelle und eine relevante Rubrik. Beschränke die Ansicht auf gemeinsam gemessene Benchmarks. Prüfe anschließend die Vergleichskennzeichnung und Messdetails, bevor du ein Referenzmodell und dessen Abstände interpretierst. Auch ein technisch zulässiger Abstand ist noch kein Signifikanztest.

Unsere Schlussfolgerung: Ein zusätzlicher Herstellerwert verbessert die Informationslage, ohne automatisch eine weitere faire Rangposition zu schaffen. Die sichtbare Trennung dieser Fälle ist hilfreicher, als jeden verfügbaren Wert in dieselbe Rangliste zu zwingen.

03

Mehr Thinking ist kein garantierter Bestwert

Mehr Rechenaufwand wird oft mit einem besseren Ergebnis gleichgesetzt. Wir suchen im veröffentlichten Datenbestand nach dokumentierten Fällen, in denen eine höhere feste Thinking-Stufe unter demselben ausgewiesenen Testaufbau einen ungünstigeren Punktwert hat.

Ein Gegenbeispiel widerlegt die Annahme einer garantierten Steigerung. Es sagt nicht, dass weniger Thinking generell besser ist.

Beispiele aus dem Datenstand

Wir vergleichen nur feste dokumentierte Stufen innerhalb desselben Modells, derselben Quelle, Testversion, Aufgabenmenge, Metrik, Werkzeuge, Agentensteuerung und Bewertung. Soweit berichtet, muss auch die Stichprobengröße übereinstimmen. Wir verwenden aktuelle, frische Belege der kanonischen Spur ohne ausgewiesenen Konflikt oder Kontaminationshinweis. Mehrdeutige Mehrfachwerte derselben Stufe werden ausgelassen.

Claude Fable 5.1 · CritPt
xhigh31.1 %
max29.7 %

CritPt current leaderboard · Epoch AI mirror · CritPt

Datumsgrundlage der Belege: 2. September 2026 / 2. September 2026. Kein Nachweis eines kausalen Thinking-Effekts.

Claude Fable 5 · Vending 2
high5680.26 USD
max4966.64 USD

Vending-Bench 2 current leaderboard · Epoch AI mirror · Vending-Bench 2

Datumsgrundlage der Belege: 2. September 2026 / 2. September 2026. Kein Nachweis eines kausalen Thinking-Effekts.

Claude Opus 4.7 · ARC-AGI-1
high93.5 %
max92.0 %

ARC-AGI-1 current leaderboard · Epoch AI mirror · ARC-AGI-1

Datumsgrundlage der Belege: 2. September 2026 / 2. September 2026. Kein Nachweis eines kausalen Thinking-Effekts.

Was diese Beispiele aussagen

Die Beispiele sind gezielt ausgewählte Gegenbeispiele, keine repräsentative Stichprobe und keine Häufigkeitsschätzung. Unterschiedliche Testzeitpunkte und nicht berichtete Einstellungen können weiter eine Rolle spielen. Ohne Wiederholungen und passende Unsicherheitsanalyse lässt sich die Ursache eines Punktabstands nicht bestimmen.

Deshalb zeigt unsere Tabelle standardmäßig die höchste dokumentierte Stufe innerhalb der ausgewählten Testreihe und nicht den nachträglich besten Score aller Stufen. Das macht die Auswahlregel nachvollziehbar. Bei deiner eigenen Anwendung sollten Qualität, Antwortzeit und Kosten gemeinsam getestet werden; aus den hier gezeigten Qualitätsscores allein entsteht keine Effizienzrangliste.

Wer betreibt diese Seite?

LLM Benchmarks wird von Christopher Böhm privat betrieben. Das Projekt hilft dabei, veröffentlichte Modelltests mit ihren Quellen und Einschränkungen an einem Ort zu vergleichen.

Eine nachvollziehbare Auswahl ist uns wichtiger als eine scheinbar eindeutige Bestenliste. Jeder Vergleich soll bis zu seinen Belegen zurückverfolgt werden können.

Was wir beitragen

Wir ordnen Modellidentitäten und Benchmark-Versionen zu, trennen unterschiedliche Testbedingungen, kennzeichnen unsichere oder widersprüchliche Angaben und stellen Vergleichs- und Exportfunktionen bereit. Die Erklärungen und Analysen in diesem Bereich machen diese Entscheidungen sichtbar. Wir beanspruchen die zugrunde liegenden fremden Messungen nicht als eigene Tests.

Verantwortung und Pflege

Betreiber und Ansprechpartner ist Christopher Böhm. Datenerfassung und technische Prüfungen sind teilweise automatisiert. Veröffentlichungsregeln, Quellenzuordnung und kuratierte Zusatzbelege werden im Projekt gepflegt. Automatisierung kann Fehler übernehmen; Quellenlinks, Messdetails und der Korrekturkontakt sind deshalb Teil des Angebots.

Finanzierung und Auswahlregeln

Der Betreiber bietet freiwillige Unterstützung über PayPal an. Außerdem ist die Website für eine manuelle AdSense-Werbefläche vorbereitet. Modellaufnahme, Messwertauswahl und Ränge folgen den im Methodikbereich beschriebenen Datenregeln. Ein Quellenhinweis dokumentiert die Herkunft eines Ergebnisses und ist keine Produktempfehlung.

Kontakt und Korrekturen

Du hast einen falschen Wert, eine unpassende Modellzuordnung oder eine fehlende Einschränkung gefunden? Sende uns den Modellnamen, den Benchmark, die betroffene Angabe und möglichst einen Originalbeleg. Auch Hinweise auf bislang fehlende veröffentlichte Tests sind willkommen. Bitte sende keine vertraulichen Daten.