Quellenbelegte Messwerte
Wissen & Methodik
Benchmarks verstehen, Messwerte fair vergleichen und die Quellen hinter LLM Benchmarks nachvollziehen. Mit Methodik, Benchmark-Lesehilfe und datenbasierten Analysen.
Wie kommen die Werte zustande?
Ein Score ist erst dann hilfreich, wenn klar ist, welches Modell unter welchen Bedingungen getestet wurde. Hier erklären wir, wie wir veröffentlichte Ergebnisse auswählen, prüfen und in der Tabelle einordnen.
Unsere eigene Leistung ist die Zusammenführung und Prüfung der Belege. Die verlinkten Benchmark-Betreiber und Modellanbieter führen die zugrunde liegenden Tests durch.
1. Welche Modelle und Quellen erscheinen?
Die Auswahl verbindet Modelle aus dem Epoch Capabilities Index mit weiteren anspruchsvollen Tests, geprüften neuen Herstellerveröffentlichungen und einem eigenen Kontingent offener Modelle. So werden auch kleinere Checkpoints berücksichtigt, die auf großen Ranglisten wenig vertreten sind. Die Auswahl bildet einen Ausschnitt des Marktes ab und ist kein vollständiges Modellverzeichnis.
Wir verwenden Ergebnisse von Benchmark-Betreibern, unabhängigen Evaluatoren und belegten Herstellerberichten. Modellidentität, Quelle, Testversion und Veröffentlichungsbedingungen müssen nachvollziehbar sein. Ein öffentlich erreichbarer Wert wird nicht automatisch zur Veröffentlichung freigegeben. Herstellerangaben bleiben als solche erkennbar.
2. Wann sind zwei Werte vergleichbar?
Der Benchmark-Name allein reicht nicht. Wir berücksichtigen Release, Version, Aufgabenfenster, Metrik, Einheit, Werkzeuge, Agentenaufbau und Bewertungsverfahren. Für jeden Benchmark ist eine Vergleichsspur definiert. Werte aus abweichenden Aufbauten können zusätzliche Information liefern, erhalten aber nicht stillschweigend denselben Rangstatus.
- Rang: Einordnung innerhalb des jeweiligen zulässigen Benchmark-Protokolls; kein Gesamturteil über das Modell.
- ≈: ergänzender Wert mit abweichenden Bedingungen. Erst die Messdetails prüfen.
- Konflikt: glaubwürdige Quellen widersprechen sich beim gleichen dokumentierten Aufbau. Kein belastbarer Einzelrang.
- Leere Zelle: kein passender sichtbarer Messwert. Sie bedeutet weder null Punkte noch eine gescheiterte Evaluation.
3. Welche Thinking-Stufe wird gewählt?
Innerhalb derselben Quelle und Testreihe bevorzugen wir die höchste dokumentierte feste Stufe: max, xhigh, high, medium, low, minimal, off. Dabei wird nicht nachträglich der höchste Punktwert herausgesucht. Ein gültiger Max-Lauf kann deshalb einen niedrigeren Score zeigen als High. Andere Agenten, Testversionen oder Aufgabenfenster werden nicht wegen einer höheren Stufe vermischt.
Adaptiv bedeutet, dass Thinking eingeschaltet ist, aber kein festes Max-Budget belegt ist. Unbekannte Einstellungen bleiben unbekannt. Auch zwei Anbieterbezeichnungen „High“ stehen nicht automatisch für denselben Rechenaufwand.
4. Was bedeuten Datum und Quellenvertrauen?
Testdatum, Veröffentlichung, Datensatzversion und erster beobachteter Wert sind unterschiedliche Ereignisse. Wenn eine Quelle kein Datum für einen einzelnen Test nennt, verwenden wir gegebenenfalls den Zeitpunkt, an dem dieser exakte Wert erstmals erfasst wurde. Das beweist kein neues Testdatum. Die Messdetails nennen die jeweilige Datumsgrundlage.
Quellenvertrauen und Belegqualität werden getrennt bewertet. Die Stufen A+, A, B und C sind unsere Ordnung der Quellen und Belege; sie sind keine statistische Wahrscheinlichkeit, dass eine Zahl stimmt. Ein hoher Quellenrang hebt abweichende Testbedingungen nicht auf.
5. Was die Tabelle nicht belegt
Kleine Punktabstände sind ohne passende Unsicherheitsanalyse kein nachgewiesener Leistungsvorsprung. Prozentpunkte sind keine relative Prozentverbesserung. Ein aggregierter Index misst außerdem etwas anderes als die Erfolgsquote bei einer konkreten Aufgabe; wir mitteln die verschiedenen Spalten nicht zu einem eigenen Gesamtscore.
Quantisierung und Hardware bleiben ergänzende Studien. Unterschiedliche Backends, GPUs oder Aufgabenteilmengen verhindern eine Aussage über den Einfluss der Quantisierung allein. Gewichtsdateigröße, GPU-Kapazität und gemessener Speicherverbrauch sind unterschiedliche Angaben. Die publizierten Hardwaretests sind keine eigenen Labormessungen von LLM Benchmarks.
6. Belege prüfen und Fehler melden
Öffne einen Tabellenwert, um Quelle, Testaufbau, Datum und verfügbare Thinking-Varianten zu prüfen. Die Daten lassen sich als CSV und JSON herunterladen. Bei einem Fehler helfen uns Modellname, Benchmark, betroffener Wert und ein Link zum Originalbeleg. Geänderte Quellen werden erneut gegen die Veröffentlichungsregeln geprüft; ein bestätigter Fehler wird im Datenbestand korrigiert.
Was misst welcher Benchmark?
Die passende Kennzahl hängt von deiner Aufgabe ab. Ein breiter Fähigkeitsindex, eine Wissensprüfung und ein Coding-Agent testen verschiedene Dinge. Diese Lesehilfe zeigt, welche Schlüsse jeweils sinnvoll sind.
Beginne mit deiner Aufgabe, prüfe anschließend das Testprotokoll und vergleiche erst dann die Punktwerte.
Gesamtbild: ECI und zusammengesetzte Indizes
Der Epoch Capabilities Index bündelt Ergebnisse verschiedener Tests auf einer gemeinsamen Fähigkeitsskala. Er hilft bei einer ersten Einordnung über mehrere Aufgabenbereiche. Sein Wert ist kein Prozentsatz gelöster Aufgaben. Mit neuen Daten können sich auch Schätzwerte für unveränderte Modelle verschieben.
Unsere Einordnung: Nutze einen Index für eine Vorauswahl und prüfe anschließend die für dich relevanten Einzeltests. Ein spezialisierter Assistent kann für deinen Einsatz passen, obwohl sein breiter Indexwert niedriger liegt. Werte verschiedener Indizes darfst du nicht direkt voneinander abziehen.
Wissen und Schlussfolgern: GPQA, HLE und Mathematik
GPQA umfasst anspruchsvolle, von Fachleuten erstellte Fragen aus Biologie, Physik und Chemie. In der Tabelle ist das Diamond-Teilset maßgeblich. Solche Tests geben Hinweise auf fachliches Problemlösen unter dem jeweiligen Prüfaufbau. Sie messen nicht automatisch die Zuverlässigkeit eines Assistenten bei offenen Recherchefragen.
Bei HLE bleiben Text und vollständiger Aufgabenbestand getrennt. Werkzeugzugriff kann die Aufgabe verändern. Bei Mathematiktests ist die Aufgabenschwierigkeit entscheidend: Ein guter Wert auf einem älteren oder leichteren Set ersetzt keinen Beleg für neuere schwere Aufgaben. Für eine Wissensanwendung würden wir zusätzlich eigene Fragen mit prüfbaren Quellen testen.
Coding: Einzelaufgabe oder vollständiger Agent?
Ein Coding-Test kann eine abgegrenzte Programmieraufgabe bewerten oder einen Agenten durch ein bestehendes Repository arbeiten lassen. SWE-bench untersucht die Bearbeitung realer Softwareprobleme. Dabei beeinflussen auch Werkzeuge, Agentensteuerung und Testumgebung das Ergebnis.
Unsere Einordnung: Wer einen Coding-Agenten auswählt, sollte einen belegten Systemaufbau vergleichen. Für einzelne Codefunktionen kann ein engerer Coding-Test passender sein. Verified, Pro und wechselnde Rebench-Aufgabenfenster sind keine austauschbaren Messlatten. Ein Erfolg auf einem Set ist keine Erfolgsprognose für dein Repository.
Agenten und Werkzeuge: Der Ablauf gehört zum Test
Bei Terminal-, Werkzeug- und mehrstufigen Agententests muss ein Modell innerhalb einer vorgegebenen Umgebung handeln. Verfügbare APIs, Agentenaufbau, Zeit- und Aufruflimits gehören damit zur Bedeutung des Scores. In unserer Tabelle bleiben beispielsweise die beiden Banking-Testaufbauten getrennt.
Unsere Einordnung: Ein solcher Wert ist besonders dann nützlich, wenn der Test deinem Ablauf ähnelt. Für einen Produktiveinsatz fehlen sonst entscheidende Aspekte wie Berechtigungen, Wiederherstellung nach Fehlern und deine eigenen Erfolgskriterien. Prüfe deshalb die Messdetails und teste eine kleine Auswahl typischer eigener Abläufe.
Anweisungen und Präferenzen richtig lesen
IFEval prüft objektiv überprüfbare Anweisungen, etwa geforderte Ausgabeformen. Das ist hilfreich, wenn dein Ablauf auf die Einhaltung konkreter Vorgaben angewiesen ist. Es belegt weder umfassende Faktentreue noch die fachliche Qualität jeder Antwort.
Arena-Ranglisten spiegeln Präferenzen im jeweiligen Vergleichsverfahren wider. Eine bevorzugte Antwort ist nicht zwangsläufig fachlich korrekt. Unsere Einordnung: Für Schreibstil kann eine Präferenzmessung relevant sein; für überprüfbare Richtigkeit braucht es zusätzlich eine fachliche Prüfung.
Alle Benchmarks der Vergleichstabelle
Das folgende Verzeichnis verlinkt die Originalseiten und nennt die bei uns verwendete Vergleichsspur. Deren Versions- und Aufgabenangaben sind wichtiger als ein ähnlich klingender Benchmark-Name. Die Gruppierung dient der Orientierung; sie ist keine Gewichtung für einen Gesamtrang.
Gesamt
Epoch Capabilities Index
Von Epoch AI aus mehr als 50 Benchmarks abgeleiteter zusammengesetzter Fähigkeitsindex.
- Vergleichsquelle
- Epoch Capabilities Index
- Version / Aufgaben
- Epoch ECI snapshot 2026-10-01 · official-composite-fit
- Metrik / Einheit
- eci · index_points
Artificial Analysis Intelligence Index
Zusammengesetzter Intelligence Index von Artificial Analysis; ein Wert je Modell und Reasoning-Einstellung. Das Protokoll nennt die Version der Bewertungsmethode.
- Vergleichsquelle
- Artificial Analysis · Intelligence Index evaluations
- Version / Aufgaben
- Artificial Analysis Intelligence Index v4.3 · intelligence-index-v4-3
- Metrik / Einheit
- index_score · points
Arena Text
Rangliste für Textmodelle nach menschlichen Präferenzen.
- Vergleichsquelle
- Arena Text
- Version / Aufgaben
- 2026-09-30 · overall-style-control
- Metrik / Einheit
- arena_score · points
LiveBench
Häufig aktualisierte objektive Evaluation über ein breites Fähigkeitsspektrum.
- Vergleichsquelle
- LiveBench
- Version / Aufgaben
- 2026-06-25 · overall-seven-category
- Metrik / Einheit
- category_balanced_average · percent
Wissen und Reasoning
Humanity's Last Exam · Full multimodal
Vergleichbare Werte nutzen das vollständige multimodale 2.500-Fragen-Protokoll ohne Tools; Text- und Tool-Läufe bleiben getrennt.
- Vergleichsquelle
- Scale AI Labs · Humanity's Last Exam Full
- Version / Aufgaben
- HLE finalized 2,500 · Scale protocol 2025-04-03 · full-multimodal-2500-no-tools
- Metrik / Einheit
- accuracy · percent
Humanity's Last Exam · Text-only
Textmenge von Artificial Analysis: 2.158 der 2.500 Fragen, ohne Tools. Eine andere Fragenmenge, keine schwächere Messung des vollen Protokolls.
- Vergleichsquelle
- Artificial Analysis · Intelligence Index evaluations
- Version / Aufgaben
- HLE text-only (Artificial Analysis) · text-only-2158-no-tools
- Metrik / Einheit
- accuracy · percent
SimpleQA Verified
Faktenwissen bei Kurzantworten und Qualität des Enthaltens.
- Vergleichsquelle
- Epoch AI SimpleQA Verified
- Version / Aufgaben
- Epoch independent Inspect runs · verified-1000-epoch-inspect
- Metrik / Einheit
- accuracy · percent
GPQA Diamond
Naturwissenschaftliche Fragen auf Hochschulniveau aus Physik, Chemie und Biologie.
- Vergleichsquelle
- Vals AI GPQA Diamond
- Version / Aufgaben
- GPQA Diamond v1 · Vals dual-prompt · diamond-198-zero-and-five-shot-cot
- Metrik / Einheit
- accuracy · percent
MMLU-Pro
Broad academic multiple-choice knowledge and reasoning across fourteen subjects; Vals AI's independent run over the MMLU-Pro set.
- Vergleichsquelle
- Vals AI · MMLU-Pro
- Version / Aufgaben
- Vals MMLU-Pro v1 · vals-mmlu-pro-overall
- Metrik / Einheit
- accuracy · percent
FrontierMath T1–3
Unabhängige Epoch-AI-Läufe über 295 von Experten erstellte Aufgaben höherer Mathematik; Tier 4 bleibt getrennt.
- Vergleichsquelle
- Epoch AI · FrontierMath Tiers 1–3 v2
- Version / Aufgaben
- 2.0.0 · private-285-of-295-problem-tiers-1-3-set
- Metrik / Einheit
- mean_score · percent
ARC-AGI-2
Abstrakte Regelinduktion über 360 Evaluationsaufgaben; pass@2-Varianten bleiben nach Thinking-Stufe getrennt.
- Vergleichsquelle
- ARC-AGI-2
- Version / Aufgaben
- v2 · semi-private-120
- Metrik / Einheit
- accuracy · percent
FrontierMath T4
Independent Epoch AI runs on the 41 private research-level problems from the 43-problem FrontierMath Tier 4 v2 set; the two public examples and Tiers 1–3 are not mixed into this column.
- Vergleichsquelle
- Epoch AI · FrontierMath Tier 4 v2
- Version / Aufgaben
- 2.0.0 · private-41-of-43-problem-tier-4-set
- Metrik / Einheit
- mean_score · percent
MMMU-Pro
Multimodales Expertenwissen und Reasoning.
- Vergleichsquelle
- Vals AI · MMMU-Pro
- Version / Aufgaben
- Vals MMMU-Pro v1 · vals-mmmu-pro-overall
- Metrik / Einheit
- accuracy · percent
CritPt
Physik-Forschungsaufgaben: 71 offene Herausforderungen, automatisch bewertet.
- Vergleichsquelle
- Artificial Analysis · Intelligence Index evaluations
- Version / Aufgaben
- CritPt (Artificial Analysis) · 70-challenges-official-grading
- Metrik / Einheit
- accuracy · percent
SimpleBench
Alltagslogik mit Fangfragen, bei denen Menschen Spitzenmodelle noch schlagen; Mittel aus fünf Läufen.
- Vergleichsquelle
- Epoch AI mirror · SimpleBench
- Version / Aufgaben
- SimpleBench current leaderboard · official-set-avg-at-5
- Metrik / Einheit
- accuracy_avg_at_5 · percent
Chess Puzzles
100 enginegenerierte Schachrätsel von Epoch AI mit genau einem besten Zug; von Epoch datiert ausgeführt.
- Vergleichsquelle
- Epoch AI · Chess Puzzles
- Version / Aufgaben
- Epoch AI Chess Puzzles v1 · 100-engine-generated-single-best-move-puzzles
- Metrik / Einheit
- mean_score · percent
ARC-AGI-1
Ursprüngliche ARC-AGI-Abstraktionsrätsel auf dem semi-privaten Set laut ARC Prize.
- Vergleichsquelle
- Epoch AI mirror · ARC-AGI-1
- Version / Aufgaben
- ARC-AGI-1 current leaderboard · semi-private-evaluation-pass-at-2
- Metrik / Einheit
- pass_at_2_accuracy · percent
IFEval
Instruction following. Provider reports and subset studies retain their scoring and sample-set labels; they do not form a uniform cross-model ranking.
Ergänzende Ergebnisse; keine gemeinsame kanonische Vergleichsspur ausgewiesen.
Zur Originalseite ↗IFBench
Genaues Befolgen von Anweisungen: 300 Prompts mit 344 prüfbaren Vorgaben, strikte Trefferquote je Anweisung nach dem Swallow LLM Leaderboard.
- Vergleichsquelle
- Swallow LLM Leaderboard
- Version / Aufgaben
- swallow-evaluation-instruct · ifbench-test-300-prompts-344-instructions
- Metrik / Einheit
- inst_level_strict_acc · percent
Coding
SWE-bench Verified
Lösungsrate bei 500 verifizierten realen Softwareproblemen; der Primärvergleich nutzt einen einheitlichen minimalen Agent-Harness.
- Vergleichsquelle
- Vals AI SWE-bench Verified
- Version / Aufgaben
- SWE-bench Verified v1 · verified-500-vals-mini-swe-agent
- Metrik / Einheit
- resolved_rate · percent
SWE-rebench v2
Aktuelle, zeitfensterbasierte Lösung realer Softwareprobleme.
- Vergleichsquelle
- SWE-rebench
- Version / Aufgaben
- rolling-v2 · 2026-05-15/2026-07-01
- Metrik / Einheit
- resolved_rate · percent
SWE-bench-Live · Lite
Laufend aktualisierte Lösung realer Softwareprobleme; Agent, Modell und gemeldete Thinking-Stufe bleiben verbunden.
- Vergleichsquelle
- SWE-bench-Live · Lite
- Version / Aufgaben
- SWE-bench-Live Lite · lite-300-python
- Metrik / Einheit
- resolved_rate · percent
DeepSWE
Neue, langwierige Software-Engineering-Aufgaben mit getrennten Ergebnissen nach Harness und Thinking-Stufe.
- Vergleichsquelle
- DeepSWE official live leaderboard
- Version / Aufgaben
- DeepSWE v1.1 live leaderboard · 113-original-long-horizon-tasks
- Metrik / Einheit
- pass_at_1 · percent
SWE-bench Pro Public · Scale
Scale AI Labs' separate 731-task professional software-engineering benchmark. Results keep the submitted model, agent label, confidence interval and row-specific publication date; they are never mixed with SWE-bench Verified, SWE-rebench or vendor supplemental protocols. A July 2026 OpenAI audit reported substantial task-quality concerns, so SWE-Pro should be read as one imperfect signal rather than an absolute model ranking.
- Vergleichsquelle
- Scale AI Labs · SWE-bench Pro Public
- Version / Aufgaben
- Scale public 731-task leaderboard · public-731
- Metrik / Einheit
- resolved_rate · percent
CursorBench
Coding-Agenten-Evaluation mit expliziten Thinking-Stufen sowie Kosten-, Token- und Schrittmetadaten.
- Vergleichsquelle
- Epoch AI mirror · CursorBench
- Version / Aufgaben
- CursorBench current leaderboard · official-current-suite
- Metrik / Einheit
- score · percent
FrontierCode 1.1 · Main
Schwere Coding-Aufgaben mit Fokus auf Mergebarkeit; Harness und Thinking-Stufe bleiben am Messwert.
- Vergleichsquelle
- Epoch AI mirror · FrontierCode 1.1
- Version / Aufgaben
- FrontierCode 1.1 · main-100-hardest-tasks
- Metrik / Einheit
- mergeability_rubric_mean_at_5 · percent
IOI
IOI-Olympiadeaufgaben 2024 und 2025, von Vals AI mit Olympiade-Bewertern ausgewertet.
- Vergleichsquelle
- Vals AI · IOI
- Version / Aufgaben
- Vals IOI v2 · vals-ioi-2024-2026-overall
- Metrik / Einheit
- score · percent
LiveCodeBench
Wettbewerbs-Programmieraufgaben nach dem Trainingsstichtag; unabhängige Vals-AI-Implementierung, pass@1 gesamt.
- Vergleichsquelle
- Vals AI · LiveCodeBench
- Version / Aufgaben
- Vals LiveCodeBench v1 · vals-livecodebench-overall
- Metrik / Einheit
- pass_at_1 · percent
SciCode
Wissenschaftliches Programmieren, gemessen als Teilaufgaben-Genauigkeit mit ausführbaren Python-Tests.
- Vergleichsquelle
- Epoch AI mirror · SciCode
- Version / Aufgaben
- SciCode current leaderboard · scientific-research-coding-subproblems
- Metrik / Einheit
- subproblem_accuracy · percent
ALE-Bench
Punktbasierte algorithmische Optimierungswettbewerbe (AtCoder Heuristic); Performance-Rating.
- Vergleichsquelle
- Epoch AI mirror · ALE-Bench
- Version / Aufgaben
- ALE-Bench current leaderboard · atcoder-heuristic-contest-set
- Metrik / Einheit
- performance_rating · points
Vibe Code Bench
Vollständige Webanwendungen von Grund auf in einem Agenten-Harness, ausgewertet von Vals AI.
- Vergleichsquelle
- Vals AI · Vibe Code Bench
- Version / Aufgaben
- Vals Vibe Code Bench v1.1 · vals-vibe-code-bench-overall
- Metrik / Einheit
- score · percent
Text Arena · Coding
Menschliche Präferenzwertung für erzeugte Webanwendungen mit React und TypeScript.
- Vergleichsquelle
- Epoch AI mirror · Text Arena (Coding)
- Version / Aufgaben
- Text Arena Coding current pool · text-arena-coding-bradley-terry
- Metrik / Einheit
- bradley_terry_rating · points
WeirdML
Ungewöhnliche Machine-Learning-Aufgaben, die Modelle durch Schreiben und Ausführen von Code lösen.
- Vergleichsquelle
- Epoch AI mirror · WeirdML
- Version / Aufgaben
- WeirdML v2 current leaderboard · weirdml-v2-task-set
- Metrik / Einheit
- accuracy · percent
Agenten und Tools
Terminal-Bench 2.0
Terminal-Bench-2.0-Rangliste über 89 schwere Terminal-Aufgaben; Agent-Harness und Laufdatum bleiben am Score.
- Vergleichsquelle
- Epoch AI mirror · Terminal-Bench 2.0
- Version / Aufgaben
- Terminal-Bench 2.0 · official-89-task-set
- Metrik / Einheit
- accuracy_mean · percent
Terminal-Bench 2.1
Unabhängiger Terminal-Bench-2.1-Lauf von Vals AI mit einheitlichem Harness; Herstellerberichte bleiben ergänzend.
- Vergleichsquelle
- Vals AI · Terminal-Bench 2.1
- Version / Aufgaben
- Vals Terminal-Bench 2.1 v2.1 · vals-terminal-bench-2-1-overall
- Metrik / Einheit
- accuracy · percent
Terminal-Bench 3.0
Offizielle Agent-plus-Modell-Rangliste über 74 schwere Terminal-Aufgaben; Agent, Aufwand und Versuchszahl bleiben am Score erhalten.
- Vergleichsquelle
- Terminal-Bench 3.0
- Version / Aufgaben
- 3.0 · b936386b-4afd-4ad7-aa7f-6b52bcab9853 · official-74-task-leaderboard
- Metrik / Einheit
- accuracy · percent
τ³-Banking · Official harness
Wissensintensive mehrstufige Banking-Support-Aufgaben mit Retrieval, Tools und simuliertem Nutzer, wie auf der offiziellen Rangliste veröffentlicht.
- Vergleichsquelle
- τ³-Banking
- Version / Aufgaben
- 1.0.1 · banking_knowledge
- Metrik / Einheit
- pass_1 · percent
τ³-Banking · Artificial Analysis harness
Eigener Lauf von Artificial Analysis über dieselbe Domäne: 97 Aufgaben, BM25/grep-Retrieval und ein anderer Nutzersimulator. Der Simulator gehört zur Messung, deshalb eine eigene Spalte und keine Zweitmeinung.
- Vergleichsquelle
- Artificial Analysis · Intelligence Index evaluations
- Version / Aufgaben
- τ³-Banking (Artificial Analysis) · banking-97-tasks-gpt-5-4-mini-simulator
- Metrik / Einheit
- pass_at_1 · percent
MCP-Atlas · Scale
Real-world multi-step tool use across 1,000 tasks, 36 MCP servers and 220 tools. The comparable lane uses Scale's April 2026 rescored protocol, all public and private tasks, a 100-tool-call budget and the exact row-specific publication date.
- Vergleichsquelle
- Scale AI Labs · MCP-Atlas
- Version / Aufgaben
- MCP-Atlas April 2026 rescored protocol · all-1000-public-500-private-500
- Metrik / Einheit
- pass_rate · percent
SkillsBench v1.1
Auditierter Agentenbenchmark über 87 professionelle Aufgaben; Läufe mit und ohne bereitgestellte Skills bleiben getrennt.
- Vergleichsquelle
- SkillsBench v1.1
- Version / Aufgaben
- v1.1 · official-87-tasks-with-skills
- Metrik / Einheit
- pass_rate · percent
APEX-Agents
Langwierige professionelle Aufgaben aus Banking, Beratung und Recht mit Office-Tools und Codeausführung.
- Vergleichsquelle
- Epoch AI mirror · APEX-Agents
- Version / Aufgaben
- APEX-Agents current leaderboard · 480-professional-tasks-33-worlds
- Metrik / Einheit
- pass_at_1 · percent
Berkeley Function Calling Leaderboard V4
Function Calling, mehrstufige Tool-Nutzung und Halluzinationsresistenz im offiziellen BFCL-V4-Test.
- Vergleichsquelle
- BFCL V4
- Version / Aufgaben
- v4-ede5081a24bc · overall
- Metrik / Einheit
- overall_accuracy · percent
LMArena Agent Arena
Human preference evaluation of agent outcomes. Every score retains the submitted model, disclosed thinking label, confidence interval and observation count.
- Vergleichsquelle
- LMArena Agent Arena
- Version / Aufgaben
- 2026-09-30 · overall-ips-aggregate
- Metrik / Einheit
- ips_score · ips
AppWorld
Interactive coding-agent benchmark across controllable applications and APIs; model, method, scaffold and task/scenario metrics remain attached to each run.
- Vergleichsquelle
- AppWorld official leaderboard
- Version / Aufgaben
- official-c1f56015cf7c · test-challenge-all
- Metrik / Einheit
- task_goal_completion · percent
Vending-Bench 2
Langzeit-Geschäftssimulation: mittlerer Endsaldo in USD nach einem simulierten Jahr.
- Vergleichsquelle
- Epoch AI mirror · Vending-Bench 2
- Version / Aufgaben
- Vending-Bench 2 current leaderboard · one-simulated-year-mean-final-balance
- Metrik / Einheit
- mean_final_balance_usd · USD
GDPval-AA v2.1
Nachfolger von GDPval-AA v2: dieselben 220 Aufgaben und Prüfer, das Elo neu angepasst und an DeepSeek V4.1 Flash (max) bei 1600 festgemacht – nicht mit v2-Werten vergleichbar.
- Vergleichsquelle
- Artificial Analysis · Intelligence Index evaluations
- Version / Aufgaben
- GDPval-AA v2.1 (Crowd-BT Elo, DeepSeek V4.1 Flash (max) at 1600) · 220-tasks-elo-v2-1
- Metrik / Einheit
- elo · points
Was sagen die Daten wirklich aus?
Wir untersuchen nicht nur, welches Modell mehr Punkte hat. Diese Analysen zeigen, wo die Belege einen Vergleich tragen, wo Messungen fehlen und welche Schlussfolgerungen zu weit gehen würden.
Die Kennzahlen werden aus demselben Datenstand wie die Vergleichstabelle berechnet. Die fachliche Einordnung ist von LLM Benchmarks; die Messungen stammen aus den jeweils genannten Quellen.
Was diese Auswertungen leisten
Die Auswahl der Modelle und die Verfügbarkeit veröffentlichter Tests prägen jede Auswertung. Mehr Belege bedeuten zunächst mehr überprüfbare Information, nicht automatisch ein besseres Modell. Wir nennen deshalb jeweils Zähleinheit, Datenstand und Grenzen. Die Berichte werden mit dem veröffentlichten Datenbestand neu berechnet und sind keine unabhängigen Nachmessungen.
Konkrete Modellvergleiche und Fallbeispiele lesen →
01Kleine offene Modelle: Wie belastbar ist der Vergleich?
Wer ein kleines offenes Modell sucht, braucht mehr als einen einzelnen guten Score. Wir prüfen für die erfassten offenen Modelle unter 36 Milliarden Gesamtparametern, wie viele Benchmark-Paare überhaupt belegt sind und wo direkt vergleichbare Belege vorliegen.
Breite Messabdeckung erleichtert die Vorauswahl. Sie ist ein Maß für die verfügbare Evidenz, kein Qualitätsrang und keine Aussage über den Speicherbedarf.
Wie dicht ist die Datenlage?
Ein Paar besteht aus genau einem Modell und einem Benchmark der vollständigen Vergleichstabelle. Mehrere Thinking-Stufen zählen zusammen nur einmal; Quantisierungsstudien zählen nicht als Beleg des Basismodells. „Vergleichbar“ bedeutet, dass mindestens ein konfliktfreier Beleg mit dem Vergleichsstatus der Tabelle vorhanden ist. Es werden alle erfassten Basismodell-Konfigurationen berücksichtigt, nicht nur die gerade sichtbare Filteransicht.
Jeder Balken umfasst alle möglichen Paare seiner Rubrik. Zahlen: vergleichbar / belegt / möglich.
Eigene Zählung aus dem öffentlichen Datenexport. Datenstand: . JSON · CSV
Was folgt daraus für die Modellauswahl?
Suche zuerst Belege für deinen Aufgabenbereich. Viele Wissensmessungen schließen eine Lücke bei Coding-Agenten nicht. Vergleiche anschließend nur die gemeinsam gemessenen Benchmarks deiner Kandidaten und prüfe dort das Protokoll. Eine unbekannte Gesamtgröße wird nicht aus dem Modellnamen geraten und führt nicht zur Aufnahme in diese Unter-36B-Auswertung.
Die hellen Bereiche der Grafik sind offene Informationslücken in unserem Bestand. Ein Modell kann anderswo getestet worden sein, ohne dass wir einen veröffentlichbaren Beleg erfasst haben. Die Auswahl der Modelle ist zudem kuratiert. Deshalb lässt sich aus den Balken kein allgemeiner Vorsprung offener oder geschlossener Modelle ableiten.
So lässt sich die Auswertung nachvollziehen
Im JSON-Export: offene Modelle mit belegter Gesamtparameterzahl größer null und kleiner 36 Milliarden auswählen. Nur Benchmarks der Website berücksichtigen. Je Modell und Benchmark Basismodell-Belege zusammenfassen; Varianten mit Quantisierung getrennt halten. Die Datenbasis umfasst auch ältere noch veröffentlichte Werte. Für eine aktuelle Kauf- oder Einsatzentscheidung ist das jeweilige Messdatum zusätzlich zu prüfen.
02Gleicher Benchmark, andere Bedingungen
Zwei veröffentlichte Zahlen können beide richtig sein und trotzdem keinen fairen Abstand ergeben. Wir zählen, für wie viele Modell-Benchmark-Paare überhaupt vergleichbare Belege vorliegen, und erklären den Unterschied anhand unserer Testspuren.
Gemeinsam gemessen bedeutet nicht automatisch direkt vergleichbar. Vor jeder Differenz müssen Version, Aufgaben und Testaufbau zusammenpassen.
Belegt ist nicht immer vergleichbar
Die Auswertung zählt Paare aus allen ausgewählten Modellen und Benchmarks der Website. Sobald mindestens ein Basismodell-Beleg vorhanden ist, zählt das Paar als belegt. Vergleichbare Paare benötigen zusätzlich mindestens einen konfliktfreien Beleg mit dem entsprechenden Tabellenstatus. Der Rest enthält nur ergänzende oder anderweitig nicht direkt vergleichbare Belege. Thinking-Varianten werden nicht mehrfach gezählt.
Jeder Balken umfasst alle möglichen Paare seiner Rubrik. Zahlen: vergleichbar / belegt / möglich.
Eigene Zählung aus dem öffentlichen Datenexport. Datenstand: . JSON · CSV
Drei Situationen, in denen ein Abstand täuscht
SWE-bench: Ein Modell in einem Hersteller-Agenten und ein anderes in einem einheitlichen Evaluationsaufbau sind zunächst zwei Systeme. Unser strenger Verified-Vergleich verwendet die definierte Vals-Spur. Bei Pro bleiben berichtete Systemwerte von der unmittelbar vergleichbaren Spur getrennt.
HLE: Ein vollständiger Aufgabenbestand und ein Text-Teilset haben unterschiedliche Nenner. Werkzeugnutzung verändert zusätzlich die erlaubten Lösungswege. Ein Prozentpunktabstand zwischen diesen Aufbauten wäre keine isolierte Modellverbesserung.
SWE-rebench: Wechselnde Aufgabenfenster verändern, welche Probleme gelöst werden müssen. Ein älteres belegtes Fenster kann eine eigene Vergleichsgruppe bilden. Seine Rangnummer gehört dann zu diesem Fenster und darf nicht mit dem aktuellen Fenster gleichgesetzt werden.
Ein belastbarer Vergleich in drei Schritten
Wähle zwei bis vier Modelle und eine relevante Rubrik. Beschränke die Ansicht auf gemeinsam gemessene Benchmarks. Prüfe anschließend die Vergleichskennzeichnung und Messdetails, bevor du ein Referenzmodell und dessen Abstände interpretierst. Auch ein technisch zulässiger Abstand ist noch kein Signifikanztest.
Unsere Schlussfolgerung: Ein zusätzlicher Herstellerwert verbessert die Informationslage, ohne automatisch eine weitere faire Rangposition zu schaffen. Die sichtbare Trennung dieser Fälle ist hilfreicher, als jeden verfügbaren Wert in dieselbe Rangliste zu zwingen.
03Mehr Thinking ist kein garantierter Bestwert
Mehr Rechenaufwand wird oft mit einem besseren Ergebnis gleichgesetzt. Wir suchen im veröffentlichten Datenbestand nach dokumentierten Fällen, in denen eine höhere feste Thinking-Stufe unter demselben ausgewiesenen Testaufbau einen ungünstigeren Punktwert hat.
Ein Gegenbeispiel widerlegt die Annahme einer garantierten Steigerung. Es sagt nicht, dass weniger Thinking generell besser ist.
Beispiele aus dem Datenstand
Wir vergleichen nur feste dokumentierte Stufen innerhalb desselben Modells, derselben Quelle, Testversion, Aufgabenmenge, Metrik, Werkzeuge, Agentensteuerung und Bewertung. Soweit berichtet, muss auch die Stichprobengröße übereinstimmen. Wir verwenden aktuelle, frische Belege der kanonischen Spur ohne ausgewiesenen Konflikt oder Kontaminationshinweis. Mehrdeutige Mehrfachwerte derselben Stufe werden ausgelassen.
Claude Fable 5.1 · CritPt
CritPt current leaderboard · Epoch AI mirror · CritPt
Datumsgrundlage der Belege: 2. September 2026 / 2. September 2026. Kein Nachweis eines kausalen Thinking-Effekts.
Claude Fable 5 · Vending 2
Vending-Bench 2 current leaderboard · Epoch AI mirror · Vending-Bench 2
Datumsgrundlage der Belege: 2. September 2026 / 2. September 2026. Kein Nachweis eines kausalen Thinking-Effekts.
Claude Opus 4.7 · ARC-AGI-1
ARC-AGI-1 current leaderboard · Epoch AI mirror · ARC-AGI-1
Datumsgrundlage der Belege: 2. September 2026 / 2. September 2026. Kein Nachweis eines kausalen Thinking-Effekts.
Was diese Beispiele aussagen
Die Beispiele sind gezielt ausgewählte Gegenbeispiele, keine repräsentative Stichprobe und keine Häufigkeitsschätzung. Unterschiedliche Testzeitpunkte und nicht berichtete Einstellungen können weiter eine Rolle spielen. Ohne Wiederholungen und passende Unsicherheitsanalyse lässt sich die Ursache eines Punktabstands nicht bestimmen.
Deshalb zeigt unsere Tabelle standardmäßig die höchste dokumentierte Stufe innerhalb der ausgewählten Testreihe und nicht den nachträglich besten Score aller Stufen. Das macht die Auswahlregel nachvollziehbar. Bei deiner eigenen Anwendung sollten Qualität, Antwortzeit und Kosten gemeinsam getestet werden; aus den hier gezeigten Qualitätsscores allein entsteht keine Effizienzrangliste.
Wer betreibt diese Seite?
LLM Benchmarks wird von Christopher Böhm privat betrieben. Das Projekt hilft dabei, veröffentlichte Modelltests mit ihren Quellen und Einschränkungen an einem Ort zu vergleichen.
Eine nachvollziehbare Auswahl ist uns wichtiger als eine scheinbar eindeutige Bestenliste. Jeder Vergleich soll bis zu seinen Belegen zurückverfolgt werden können.
Was wir beitragen
Wir ordnen Modellidentitäten und Benchmark-Versionen zu, trennen unterschiedliche Testbedingungen, kennzeichnen unsichere oder widersprüchliche Angaben und stellen Vergleichs- und Exportfunktionen bereit. Die Erklärungen und Analysen in diesem Bereich machen diese Entscheidungen sichtbar. Wir beanspruchen die zugrunde liegenden fremden Messungen nicht als eigene Tests.
Verantwortung und Pflege
Betreiber und Ansprechpartner ist Christopher Böhm. Datenerfassung und technische Prüfungen sind teilweise automatisiert. Veröffentlichungsregeln, Quellenzuordnung und kuratierte Zusatzbelege werden im Projekt gepflegt. Automatisierung kann Fehler übernehmen; Quellenlinks, Messdetails und der Korrekturkontakt sind deshalb Teil des Angebots.
Finanzierung und Auswahlregeln
Der Betreiber bietet freiwillige Unterstützung über PayPal an. Außerdem ist die Website für eine manuelle AdSense-Werbefläche vorbereitet. Modellaufnahme, Messwertauswahl und Ränge folgen den im Methodikbereich beschriebenen Datenregeln. Ein Quellenhinweis dokumentiert die Herkunft eines Ergebnisses und ist keine Produktempfehlung.
Kontakt und Korrekturen
Du hast einen falschen Wert, eine unpassende Modellzuordnung oder eine fehlende Einschränkung gefunden? Sende uns den Modellnamen, den Benchmark, die betroffene Angabe und möglichst einen Originalbeleg. Auch Hinweise auf bislang fehlende veröffentlichte Tests sind willkommen. Bitte sende keine vertraulichen Daten.