LLM Benchmarks

有来源依据的测量结果

分析与模型案例

通过具体测量比较小型开放权重模型,并解读不同的 SWE-bench 结果。提供原创分析、来源与明确的局限说明。

三个总参数少于 360 亿的开放模型

我们选取 Qwen 3.8 27B、Qwen 3.6 35B-A3B 和 Gemma 4 31B IT 作为编辑案例,涵盖两家提供商以及稠密和 MoE 架构。这不是最佳模型排名。首先应确认,同一任务是否存在可比的测量。

Qwen 3.8 27B

总参数: 27 十亿

稠密模型

Qwen 3.6 35B-A3B

总参数: 35 十亿

活跃参数: 3 十亿

混合专家模型(MoE)

Gemma 4 31B IT

总参数: 30.7 十亿

稠密模型

每个模型和测试均采用按主表规则选定的基础结果。排除量化变体、过时或未获当前确认的证据、冲突和污染警告。同一图组必须具有相同来源、测试版本、任务、指标、智能体、工具和评分设置。不同思考设置仍会显示;这并不能证明计算预算相同。

刻度为 0–100%。仅同组数值共享所列测试设置;不计算跨组优势。

GPQA

单独证据:本例中没有设置匹配的比较对象
Vals AI GPQA Diamond · GPQA Diamond v1 · Vals dual-prompt · diamond-198-zero-and-five-shot-cot
Qwen 3.8 27B88.89 %
推理强度: xhigh

原始证据: Vals AI GPQA Diamond ↗

证据日期(来源或观测):

没有符合这些规则的当前基础结果: Qwen 3.6 35B-A3B · Gemma 4 31B IT.

基准指南 →

SciCode

共同披露的评测设置
Epoch AI mirror · SciCode · SciCode current leaderboard · scientific-research-coding-subproblems
Qwen 3.8 27B46.6 %
推理强度: xhigh

原始证据: Epoch AI mirror · SciCode ↗

证据日期(来源或观测):

Qwen 3.6 35B-A3B1.3 %
推理强度: 关闭

原始证据: Epoch AI mirror · SciCode ↗

证据日期(来源或观测):

Gemma 4 31B IT43.4 %
推理强度: 未说明

原始证据: Epoch AI mirror · SciCode ↗

证据日期(来源或观测):

本组中显示的最高点估计: Qwen 3.8 27B.

基准指南 →

LiveCodeBench

单独证据:本例中没有设置匹配的比较对象
Vals AI · LiveCodeBench · Vals LiveCodeBench v1 · vals-livecodebench-overall
Qwen 3.8 27B84 %
推理强度: xhigh

原始证据: Vals AI · LiveCodeBench ↗

证据日期(来源或观测):

没有符合这些规则的当前基础结果: Qwen 3.6 35B-A3B · Gemma 4 31B IT.

基准指南 →

点估计较高不代表具有统计优势。已披露的设置仍可能存在未报告的差异。

GPQA 反映科学问题求解能力,SciCode 关注科学编程,LiveCodeBench 关注竞赛编程。因此,GPQA 领先并不能确定哪个模型更适合处理你的代码。应先选任务领域,再在同一组内比较数值。

我们的结论是:与任务相关的共同证据,比这三个测试的平均值更有助于筛选候选模型。缺少共同测量时,信息缺口依然存在。总参数量本身也不能确定量化本地部署的实际内存需求或速度。

在比较表中打开这三个模型 →

↑ 返回主题目录

同一个模型,两种 SWE-bench 结果

Claude Opus 5 说明了为什么仅有模型名和测试名还不够。我们并列展示 Vals 的独立运行和提供商的补充报告。每个结果都与其来源和评测设置绑定。

统一比较运行

Claude Opus 5 · SWE-bench

97 %

披露的评测设置

  • SWE-bench Verified v1
  • verified-500-vals-mini-swe-agent
  • Vals AI mini-swe-agent
  • Bash
  • Vals AI independent run over all 500 verified tasks; uniform minimal bash-only mini-swe-agent harness

原始证据: Vals AI SWE-bench Verified ↗

证据日期(来源或观测):

提供商补充报告

Claude Opus 5 · SWE-bench

96 %

披露的评测设置

  • Anthropic 500-task evaluation
  • verified-500
  • unspecified agentic harness
  • not reported
  • adaptive thinking; max effort; five-trial average

原始证据: Anthropic · Claude Opus 5 System Card ↗

证据日期(来源或观测):

Vals 记录明确列出 mini-swe-agent 和 Bash。提供商记录描述了不同或披露不完整的设置,思考与重复次数的信息也不同。因此不能将分数差归因于单一原因;它既不能证明模型进步,也不能证明某个来源出错。

比较不同模型时,我们会先采用 Vals 的统一评测组。提供商报告作为其所测系统的补充证据。用于自己的项目时,仍需在自己的代码仓库、智能体和固定时间与 token 预算下测试。

↑ 返回主题目录

将案例用于自己的候选名单

  1. 明确任务并选择二到四个候选模型。
  2. 核查共同测量与设置,明确保留信息缺口。
  3. 用自己的任务测试剩余模型的质量、延迟和成本。
方法与更多分析 →