三个总参数少于 360 亿的开放模型
我们选取 Qwen 3.8 27B、Qwen 3.6 35B-A3B 和 Gemma 4 31B IT 作为编辑案例,涵盖两家提供商以及稠密和 MoE 架构。这不是最佳模型排名。首先应确认,同一任务是否存在可比的测量。
Qwen 3.8 27B
总参数: 27 十亿
稠密模型
Qwen 3.6 35B-A3B
总参数: 35 十亿
活跃参数: 3 十亿
混合专家模型(MoE)
Gemma 4 31B IT
总参数: 30.7 十亿
稠密模型
每个模型和测试均采用按主表规则选定的基础结果。排除量化变体、过时或未获当前确认的证据、冲突和污染警告。同一图组必须具有相同来源、测试版本、任务、指标、智能体、工具和评分设置。不同思考设置仍会显示;这并不能证明计算预算相同。
刻度为 0–100%。仅同组数值共享所列测试设置;不计算跨组优势。
GPQA
Vals AI GPQA Diamond · GPQA Diamond v1 · Vals dual-prompt · diamond-198-zero-and-five-shot-cot
没有符合这些规则的当前基础结果: Qwen 3.6 35B-A3B · Gemma 4 31B IT.
基准指南 →SciCode
Epoch AI mirror · SciCode · SciCode current leaderboard · scientific-research-coding-subproblems
本组中显示的最高点估计: Qwen 3.8 27B.
LiveCodeBench
Vals AI · LiveCodeBench · Vals LiveCodeBench v1 · vals-livecodebench-overall
没有符合这些规则的当前基础结果: Qwen 3.6 35B-A3B · Gemma 4 31B IT.
基准指南 →点估计较高不代表具有统计优势。已披露的设置仍可能存在未报告的差异。
GPQA 反映科学问题求解能力,SciCode 关注科学编程,LiveCodeBench 关注竞赛编程。因此,GPQA 领先并不能确定哪个模型更适合处理你的代码。应先选任务领域,再在同一组内比较数值。
我们的结论是:与任务相关的共同证据,比这三个测试的平均值更有助于筛选候选模型。缺少共同测量时,信息缺口依然存在。总参数量本身也不能确定量化本地部署的实际内存需求或速度。
在比较表中打开这三个模型 →