LLM Benchmarks

Quellenbelegte Messwerte

Analysen & Modellbeispiele

Kleine offene LLMs anhand konkreter Messungen vergleichen und unterschiedliche SWE-bench-Ergebnisse einordnen. Eigene Auswertungen mit Quellen und klaren Grenzen.

Drei offene Modelle unter 36 Milliarden Parametern

Qwen 3.8 27B, Qwen 3.6 35B-A3B und Gemma 4 31B IT bilden unsere redaktionelle Beispielauswahl: zwei Anbieter und sowohl dichte als auch MoE-Architekturen. Die Auswahl ist keine Bestenliste. Entscheidend ist zunächst, ob für dieselbe Aufgabe vergleichbare Messungen vorliegen.

Qwen 3.8 27B

Gesamtparameter: 27 Mrd.

Dichtes Modell

Qwen 3.6 35B-A3B

Gesamtparameter: 35 Mrd.

Aktive Parameter: 3 Mrd.

Expertenmodell (MoE)

Gemma 4 31B IT

Gesamtparameter: 30,7 Mrd.

Dichtes Modell

Wir übernehmen je Modell und Benchmark den nach den Tabellenregeln ausgewählten Basiswert. Quantisierte Varianten, veraltete oder nicht mehr bestätigte Belege sowie Konflikte und Kontaminationswarnungen sind ausgeschlossen. Innerhalb jeder Grafik müssen Quelle, Testversion, Aufgaben, Metrik, Agentenaufbau, Tools und Bewertung übereinstimmen. Unterschiedliche Thinking-Einstellungen bleiben sichtbar; gleiche Rechenbudgets sind damit nicht nachgewiesen.

Skala 0–100 %. Nur Werte innerhalb derselben Gruppe teilen den ausgewiesenen Testaufbau. Zwischen Gruppen wird kein Vorsprung berechnet.

GPQA

Einzelbeleg – kein passender Vergleichspartner in dieser Auswahl
Vals AI GPQA Diamond · GPQA Diamond v1 · Vals dual-prompt · diamond-198-zero-and-five-shot-cot
Qwen 3.8 27B88,89 %
Reasoning-Aufwand: xhigh

Originalbeleg: Vals AI GPQA Diamond ↗

Belegdatum (Quelle oder Beobachtung):

Kein aktueller, nach diesen Regeln geeigneter Basiswert: Qwen 3.6 35B-A3B · Gemma 4 31B IT.

Benchmark-Lesehilfe →

SciCode

Gemeinsamer ausgewiesener Testaufbau
Epoch AI mirror · SciCode · SciCode current leaderboard · scientific-research-coding-subproblems
Qwen 3.8 27B46,6 %
Reasoning-Aufwand: xhigh

Originalbeleg: Epoch AI mirror · SciCode ↗

Belegdatum (Quelle oder Beobachtung):

Qwen 3.6 35B-A3B1,3 %
Reasoning-Aufwand: aus

Originalbeleg: Epoch AI mirror · SciCode ↗

Belegdatum (Quelle oder Beobachtung):

Gemma 4 31B IT43,4 %
Reasoning-Aufwand: Nicht ausgewiesen

Originalbeleg: Epoch AI mirror · SciCode ↗

Belegdatum (Quelle oder Beobachtung):

Höchster angezeigter Punktwert innerhalb dieser Gruppe: Qwen 3.8 27B.

Benchmark-Lesehilfe →

LiveCodeBench

Einzelbeleg – kein passender Vergleichspartner in dieser Auswahl
Vals AI · LiveCodeBench · Vals LiveCodeBench v1 · vals-livecodebench-overall
Qwen 3.8 27B84 %
Reasoning-Aufwand: xhigh

Originalbeleg: Vals AI · LiveCodeBench ↗

Belegdatum (Quelle oder Beobachtung):

Kein aktueller, nach diesen Regeln geeigneter Basiswert: Qwen 3.6 35B-A3B · Gemma 4 31B IT.

Benchmark-Lesehilfe →

Ein höherer Punktwert ist kein Nachweis statistischer Überlegenheit. Die ausgewiesenen Aufbauten können nicht berichtete Unterschiede enthalten.

GPQA ist ein Signal für naturwissenschaftliches Problemlösen. SciCode betrachtet wissenschaftliche Programmieraufgaben; LiveCodeBench Wettbewerbsprogrammierung. Ein Vorsprung bei GPQA beantwortet daher noch nicht, welches Modell deinen Code besser bearbeitet. Wähle zuerst den Aufgabenbereich und vergleiche nur Werte innerhalb derselben Gruppe.

Unsere Schlussfolgerung: Für eine Vorauswahl sind passende gemeinsame Belege hilfreicher als ein Mittelwert über diese drei Tests. Fehlt eine gemeinsame Messung, bleibt eine Wissenslücke. Gesamtparameter allein belegen außerdem weder den tatsächlichen Speicherbedarf noch die Geschwindigkeit einer quantisierten lokalen Installation.

Diese drei Modelle in der Vergleichstabelle öffnen →

↑ Zur Themenübersicht

Dasselbe Modell, zwei SWE-bench-Ergebnisse

Claude Opus 5 dient als Beispiel dafür, warum der Modellname und der Benchmarkname allein nicht reichen. Wir stellen den unabhängigen Vals-Lauf dem ergänzenden Herstellerbericht gegenüber. Beide Belege bleiben an ihre jeweilige Quelle und ihren Testaufbau gebunden.

Einheitlicher Vergleichslauf

Claude Opus 5 · SWE-bench

97 %

Ausgewiesener Testaufbau

  • SWE-bench Verified v1
  • verified-500-vals-mini-swe-agent
  • Vals AI mini-swe-agent
  • Bash
  • Vals AI independent run over all 500 verified tasks; uniform minimal bash-only mini-swe-agent harness

Originalbeleg: Vals AI SWE-bench Verified ↗

Belegdatum (Quelle oder Beobachtung):

Ergänzender Herstellerbericht

Claude Opus 5 · SWE-bench

96 %

Ausgewiesener Testaufbau

  • Anthropic 500-task evaluation
  • verified-500
  • unspecified agentic harness
  • not reported
  • adaptive thinking; max effort; five-trial average

Originalbeleg: Anthropic · Claude Opus 5 System Card ↗

Belegdatum (Quelle oder Beobachtung):

Der Vals-Beleg beschreibt mini-swe-agent und Bash. Der Herstellerbeleg beschreibt einen anderen beziehungsweise nicht vollständig offengelegten Aufbau. Auch Angaben zu Thinking und Wiederholungen unterscheiden sich. Der Zahlenabstand kann deshalb nicht einer einzelnen Ursache zugeschrieben werden; er beweist weder eine Modellverbesserung noch einen Fehler einer Quelle.

Für den Vergleich verschiedener Modelle würden wir zuerst die einheitliche Vals-Gruppe nutzen. Den Herstellerbericht verwenden wir als zusätzlichen Beleg für das dort getestete System. Für deinen eigenen Einsatz bleibt ein Test mit deinem Repository, deinem Agenten und einem festen Zeit- und Tokenbudget erforderlich.

↑ Zur Themenübersicht

So nutzt du die Beispiele für deine Auswahl

  1. Aufgabe festlegen und zwei bis vier Kandidaten auswählen.
  2. Gemeinsame Messungen und ihre Testaufbauten prüfen; Lücken ausdrücklich offenlassen.
  3. Die verbleibenden Modelle mit eigenen Aufgaben auf Qualität, Laufzeit und Kosten testen.
Methodik und weitere Analysen →