Drei offene Modelle unter 36 Milliarden Parametern
Qwen 3.8 27B, Qwen 3.6 35B-A3B und Gemma 4 31B IT bilden unsere redaktionelle Beispielauswahl: zwei Anbieter und sowohl dichte als auch MoE-Architekturen. Die Auswahl ist keine Bestenliste. Entscheidend ist zunächst, ob für dieselbe Aufgabe vergleichbare Messungen vorliegen.
Qwen 3.8 27B
Gesamtparameter: 27 Mrd.
Dichtes Modell
Qwen 3.6 35B-A3B
Gesamtparameter: 35 Mrd.
Aktive Parameter: 3 Mrd.
Expertenmodell (MoE)
Gemma 4 31B IT
Gesamtparameter: 30,7 Mrd.
Dichtes Modell
Wir übernehmen je Modell und Benchmark den nach den Tabellenregeln ausgewählten Basiswert. Quantisierte Varianten, veraltete oder nicht mehr bestätigte Belege sowie Konflikte und Kontaminationswarnungen sind ausgeschlossen. Innerhalb jeder Grafik müssen Quelle, Testversion, Aufgaben, Metrik, Agentenaufbau, Tools und Bewertung übereinstimmen. Unterschiedliche Thinking-Einstellungen bleiben sichtbar; gleiche Rechenbudgets sind damit nicht nachgewiesen.
Skala 0–100 %. Nur Werte innerhalb derselben Gruppe teilen den ausgewiesenen Testaufbau. Zwischen Gruppen wird kein Vorsprung berechnet.
GPQA
Vals AI GPQA Diamond · GPQA Diamond v1 · Vals dual-prompt · diamond-198-zero-and-five-shot-cot
Kein aktueller, nach diesen Regeln geeigneter Basiswert: Qwen 3.6 35B-A3B · Gemma 4 31B IT.
Benchmark-Lesehilfe →SciCode
Epoch AI mirror · SciCode · SciCode current leaderboard · scientific-research-coding-subproblems
Höchster angezeigter Punktwert innerhalb dieser Gruppe: Qwen 3.8 27B.
LiveCodeBench
Vals AI · LiveCodeBench · Vals LiveCodeBench v1 · vals-livecodebench-overall
Kein aktueller, nach diesen Regeln geeigneter Basiswert: Qwen 3.6 35B-A3B · Gemma 4 31B IT.
Benchmark-Lesehilfe →Ein höherer Punktwert ist kein Nachweis statistischer Überlegenheit. Die ausgewiesenen Aufbauten können nicht berichtete Unterschiede enthalten.
GPQA ist ein Signal für naturwissenschaftliches Problemlösen. SciCode betrachtet wissenschaftliche Programmieraufgaben; LiveCodeBench Wettbewerbsprogrammierung. Ein Vorsprung bei GPQA beantwortet daher noch nicht, welches Modell deinen Code besser bearbeitet. Wähle zuerst den Aufgabenbereich und vergleiche nur Werte innerhalb derselben Gruppe.
Unsere Schlussfolgerung: Für eine Vorauswahl sind passende gemeinsame Belege hilfreicher als ein Mittelwert über diese drei Tests. Fehlt eine gemeinsame Messung, bleibt eine Wissenslücke. Gesamtparameter allein belegen außerdem weder den tatsächlichen Speicherbedarf noch die Geschwindigkeit einer quantisierten lokalen Installation.
Diese drei Modelle in der Vergleichstabelle öffnen →