LLM Benchmarks

有来源依据的测量结果

指南与方法

了解基准测试、公平比较测量结果,并查阅 LLM Benchmarks 的数据来源。包含方法说明、基准指南和基于数据的分析。

分数是怎么来的?

只有明确测试的是哪个模型、采用了什么条件,分数才有参考价值。这里介绍我们如何筛选、核查并在对比表中呈现已发布的结果。

我们的贡献是汇总和核查证据。原始评测由所链接的基准测试机构和模型提供商开展。

1. 收录哪些模型和来源?

我们结合 Epoch Capabilities Index、其他高难度评测、经过核实的近期厂商发布,以及为开放模型预留的名额进行筛选。这也包括在大型排行榜中较少出现的小型模型。它是市场的一部分样本,并非完整的模型目录。

我们采用基准测试机构的结果、独立评测和有据可查的厂商报告。模型身份、来源、测试版本和发布条件必须可追溯。分数可以公开访问,不代表自动获得再次发布的许可。厂商报告始终保留来源归属。

2. 什么时候两个分数可以比较?

仅有相同的基准名称还不够。我们还考虑发布版本、测试版本、任务集或时间窗口、指标、单位、工具、智能体配置和评测流程。每项基准都有明确的对比口径。其他配置的结果可以补充信息,但不会自动获得相同的排名资格。

  • 排名:在该基准符合条件的测试协议中的位置,不是对模型的总体结论。
  • ≈:在不同条件下获得的补充证据,应先查看测量详情。
  • 冲突:可信来源对同一已记录配置给出不同结果,无法给出可靠的单一排名。
  • 空白单元格:没有符合当前显示条件的测量,既不表示零分,也不表示测试失败。

3. 选择哪个思考强度?

在同一来源和同一测试系列内,我们优先采用已记录的最高固定强度:max、xhigh、high、medium、low、minimal、off。我们不会事后挑选分数最高的一次。因此,有效的 Max 测试结果也可能低于 High。我们不会混合不同智能体、测试版本或任务窗口来取得更高的强度。

Adaptive 表示启用了思考,但不能证明存在固定的最大计算预算。未披露的设置仍标为未知。不同厂商的 High 标签也不一定代表相同的计算预算。

4. 日期和来源等级代表什么?

评测日期、发布日期、数据集版本和首次观察时间是不同的事件。若来源未标明单次测试日期,我们可能使用首次观察到该精确分数的时间。这不能证明测试是近期进行的。测量详情会说明日期的依据。

来源权威性与证据质量分别评估。A+、A、B、C 是我们对来源和证据的分类,不是分数正确的统计概率。较高的来源等级也不能消除测试条件的差异。

5. 对比表无法证明什么?

若没有适当的不确定性分析,小幅分差并不构成已证实的性能优势。百分点差异不等于相对百分比提升。综合指数与具体任务的成功率也衡量不同的事物;我们不会把各列取平均来生成自有总分。

量化和硬件结果仍属于补充研究。执行后端、GPU 或任务子集不同,会使量化本身的影响无法被单独识别。权重文件大小、GPU 容量和实际测得的内存用量是不同指标。网站发布的硬件测试并非 LLM Benchmarks 自行完成的实验室测量。

6. 核查证据和报告错误

打开表格中的数值,可查看来源、测试配置、日期和可用的思考强度版本。数据可以 CSV 和 JSON 格式下载。报告错误时,请提供模型、基准、相关数值和原始证据链接。来源发生变化后会重新按发布规则核查,确认的错误将更正到数据中。

各个基准测量什么?

有用的指标取决于你的任务。综合能力指数、知识测试和编程智能体评测衡量不同的事物。本指南帮助你理解各类结果。

先明确任务,再核查评测协议,最后比较分数。

综合能力:ECI 与综合指数

Epoch Capabilities Index 将不同测试的结果整合到共同的能力尺度上,提供跨领域的初步概览。它的数值不是已解决任务的百分比。新数据可能改变估计值,即使模型本身没有变化。

我们的解读:先用指数筛选候选模型,再查看与你的工作相关的单项测试。即使综合指数较低,专业助手仍可能适合你的任务。不同指数的分数不应直接相减。

知识与推理:GPQA、HLE 和数学

GPQA 包含由生物、物理和化学专家编写的高难度问题。表格采用 Diamond 子集。这类测试反映指定配置下的解题表现,不会自动衡量开放式研究中的可靠性。

HLE 的纯文本子集和完整任务集保持分开。工具访问权限可能改变任务性质。数学测试的难度很重要:在较旧或较简单的数据集上取得高分,并不能证明在新出现的困难任务上也有同样表现。对于知识应用,我们还会用可核查的来源测试你自己的问题。

编程:单个任务还是完整智能体?

编程评测可能测试独立的编程题,也可能测试在已有代码仓库中工作的智能体。SWE-bench 评估真实的软件问题。工具、智能体编排和测试环境也会影响结果。

我们的解读:选择编程智能体时,应比较有记录的系统配置。针对单个函数,更聚焦的编程测试可能更有参考价值。Verified、Pro 和不断变化的 Rebench 任务窗口不可互换。某个任务集上的成功不代表能预测你仓库中的成功率。

智能体与工具:工作流程也是测试的一部分

终端、工具使用和多轮智能体评测要求模型在指定环境中采取行动。可用 API、智能体配置、时间限制和调用次数限制都属于分数含义的一部分。例如,表格中的两种 Banking 配置保持分开。

我们的解读:当测试接近你的工作流程时,这类结果尤其有用。否则,权限、出错后的恢复方式和你自己的成功标准等关键因素可能尚未经过评估。请查看测量详情,并自行测试少量有代表性的实际流程。

如何理解指令遵循和偏好评测

IFEval 测试能够客观核验的指令,例如必须遵守的输出限制。当工作流程依赖具体要求的执行时,它很有帮助。但它不能证明所有回答都事实准确或具有相应领域的专业质量。

Arena 排行榜反映其对比程序下的偏好。更受偏好的回答不一定事实正确。我们的解读:偏好证据可帮助选择写作风格;若要验证正确性,还需要领域专项检查。

对比表中的全部基准

以下目录提供原始页面链接,并列出我们采用的对比口径。版本和任务信息比相似的基准名称更重要。分组仅用于导航,不是计算总体排名的权重。

综合

Epoch Capabilities Index

Epoch AI 基于 50 多项基准拟合得到的综合能力指数。

对比来源
Epoch Capabilities Index
版本 / 任务
Epoch ECI snapshot 2026-10-01 · official-composite-fit
指标 / 单位
eci · index_points
基准原始页面 ↗
Artificial Analysis Intelligence Index

Artificial Analysis' composite Intelligence Index; one value per model and reasoning setting. The protocol identifies the methodology version.

对比来源
Artificial Analysis · Intelligence Index evaluations
版本 / 任务
Artificial Analysis Intelligence Index v4.3 · intelligence-index-v4-3
指标 / 单位
index_score · points
基准原始页面 ↗
Arena Text

基于人类偏好的文本模型排名。

对比来源
Arena Text
版本 / 任务
2026-09-30 · overall-style-control
指标 / 单位
arena_score · points
基准原始页面 ↗
LiveBench

覆盖多种能力并频繁更新的客观评测。

对比来源
LiveBench
版本 / 任务
2026-06-25 · overall-seven-category
指标 / 单位
category_balanced_average · percent
基准原始页面 ↗

知识与推理

Humanity's Last Exam · Full multimodal

可比值采用完整的 2,500 题多模态无工具协议;纯文本和工具辅助运行保持分离。

对比来源
Scale AI Labs · Humanity's Last Exam Full
版本 / 任务
HLE finalized 2,500 · Scale protocol 2025-04-03 · full-multimodal-2500-no-tools
指标 / 单位
accuracy · percent
基准原始页面 ↗
Humanity's Last Exam · Text-only

Artificial Analysis 的纯文本子集:2,500 题中的 2,158 题,无工具。这是另一组题目,而非完整协议的弱化测量。

对比来源
Artificial Analysis · Intelligence Index evaluations
版本 / 任务
HLE text-only (Artificial Analysis) · text-only-2158-no-tools
指标 / 单位
accuracy · percent
基准原始页面 ↗
SimpleQA Verified

短答案事实知识与拒答质量。

对比来源
Epoch AI SimpleQA Verified
版本 / 任务
Epoch independent Inspect runs · verified-1000-epoch-inspect
指标 / 单位
accuracy · percent
基准原始页面 ↗
GPQA Diamond

物理、化学和生物学研究生水平的科学问题。

对比来源
Vals AI GPQA Diamond
版本 / 任务
GPQA Diamond v1 · Vals dual-prompt · diamond-198-zero-and-five-shot-cot
指标 / 单位
accuracy · percent
基准原始页面 ↗
MMLU-Pro

Broad academic multiple-choice knowledge and reasoning across fourteen subjects; Vals AI's independent run over the MMLU-Pro set.

对比来源
Vals AI · MMLU-Pro
版本 / 任务
Vals MMLU-Pro v1 · vals-mmlu-pro-overall
指标 / 单位
accuracy · percent
基准原始页面 ↗
FrontierMath T1–3

Epoch AI 对 295 道专家编写的高等数学题进行的独立评测;Tier 4 保持独立。

对比来源
Epoch AI · FrontierMath Tiers 1–3 v2
版本 / 任务
2.0.0 · private-285-of-295-problem-tiers-1-3-set
指标 / 单位
mean_score · percent
基准原始页面 ↗
ARC-AGI-2

在 360 项评测任务上进行抽象规则归纳,并按推理强度保留独立的 pass@2 变体。

对比来源
ARC-AGI-2
版本 / 任务
v2 · semi-private-120
指标 / 单位
accuracy · percent
基准原始页面 ↗
FrontierMath T4

Independent Epoch AI runs on the 41 private research-level problems from the 43-problem FrontierMath Tier 4 v2 set; the two public examples and Tiers 1–3 are not mixed into this column.

对比来源
Epoch AI · FrontierMath Tier 4 v2
版本 / 任务
2.0.0 · private-41-of-43-problem-tier-4-set
指标 / 单位
mean_score · percent
基准原始页面 ↗
MMMU-Pro

多模态专家知识与推理。

对比来源
Vals AI · MMMU-Pro
版本 / 任务
Vals MMMU-Pro v1 · vals-mmmu-pro-overall
指标 / 单位
accuracy · percent
基准原始页面 ↗
CritPt

Research-level physics reasoning across 71 open-ended challenges graded automatically.

对比来源
Artificial Analysis · Intelligence Index evaluations
版本 / 任务
CritPt (Artificial Analysis) · 70-challenges-official-grading
指标 / 单位
accuracy · percent
基准原始页面 ↗
SimpleBench

Trick-question common-sense reasoning where humans still beat frontier models; average of five runs.

对比来源
Epoch AI mirror · SimpleBench
版本 / 任务
SimpleBench current leaderboard · official-set-avg-at-5
指标 / 单位
accuracy_avg_at_5 · percent
基准原始页面 ↗
Chess Puzzles

Epoch AI's 100 engine-generated chess puzzles with one best move each, run and dated by Epoch.

对比来源
Epoch AI · Chess Puzzles
版本 / 任务
Epoch AI Chess Puzzles v1 · 100-engine-generated-single-best-move-puzzles
指标 / 单位
mean_score · percent
基准原始页面 ↗
ARC-AGI-1

Original ARC-AGI abstraction puzzles on the semi-private set as reported by ARC Prize.

对比来源
Epoch AI mirror · ARC-AGI-1
版本 / 任务
ARC-AGI-1 current leaderboard · semi-private-evaluation-pass-at-2
指标 / 单位
pass_at_2_accuracy · percent
基准原始页面 ↗
IFEval

Instruction following. Provider reports and subset studies retain their scoring and sample-set labels; they do not form a uniform cross-model ranking.

补充结果;未指定共同的规范对比口径。

基准原始页面 ↗
IFBench

精确遵循指令:300 个提示、344 条可验证约束,按 Swallow LLM Leaderboard 的逐条指令严格准确率计。

对比来源
Swallow LLM Leaderboard
版本 / 任务
swallow-evaluation-instruct · ifbench-test-300-prompts-344-instructions
指标 / 单位
inst_level_strict_acc · percent
基准原始页面 ↗

编程

SWE-bench Verified

500 个经验证真实软件问题的解决率;主要比较采用统一的最小智能体框架。

对比来源
Vals AI SWE-bench Verified
版本 / 任务
SWE-bench Verified v1 · verified-500-vals-mini-swe-agent
指标 / 单位
resolved_rate · percent
基准原始页面 ↗
SWE-rebench v2

按最新时间窗口选取的软件问题解决评测。

对比来源
SWE-rebench
版本 / 任务
rolling-v2 · 2026-05-15/2026-07-01
指标 / 单位
resolved_rate · percent
基准原始页面 ↗
SWE-bench-Live · Lite

持续更新的软件问题解决评测,同时保留智能体、模型和申报的推理强度。

对比来源
SWE-bench-Live · Lite
版本 / 任务
SWE-bench-Live Lite · lite-300-python
指标 / 单位
resolved_rate · percent
基准原始页面 ↗
DeepSWE

原创长时程软件工程任务,并按智能体框架和推理强度分别保留结果。

对比来源
DeepSWE official live leaderboard
版本 / 任务
DeepSWE v1.1 live leaderboard · 113-original-long-horizon-tasks
指标 / 单位
pass_at_1 · percent
基准原始页面 ↗
SWE-bench Pro Public · Scale

Scale AI Labs' separate 731-task professional software-engineering benchmark. Results keep the submitted model, agent label, confidence interval and row-specific publication date; they are never mixed with SWE-bench Verified, SWE-rebench or vendor supplemental protocols. A July 2026 OpenAI audit reported substantial task-quality concerns, so SWE-Pro should be read as one imperfect signal rather than an absolute model ranking.

对比来源
Scale AI Labs · SWE-bench Pro Public
版本 / 任务
Scale public 731-task leaderboard · public-731
指标 / 单位
resolved_rate · percent
基准原始页面 ↗
CursorBench

具有明确推理强度以及成本、令牌和步骤元数据的编码智能体评测。

对比来源
Epoch AI mirror · CursorBench
版本 / 任务
CursorBench current leaderboard · official-current-suite
指标 / 单位
score · percent
基准原始页面 ↗
FrontierCode 1.1 · Main

面向可合并性的高难编码任务,每项分数保留智能体框架和推理强度。

对比来源
Epoch AI mirror · FrontierCode 1.1
版本 / 任务
FrontierCode 1.1 · main-100-hardest-tasks
指标 / 单位
mergeability_rubric_mean_at_5 · percent
基准原始页面 ↗
IOI

IOI 2024 and 2025 olympiad problems evaluated by Vals AI with olympiad graders.

对比来源
Vals AI · IOI
版本 / 任务
Vals IOI v2 · vals-ioi-2024-2026-overall
指标 / 单位
score · percent
基准原始页面 ↗
LiveCodeBench

Competitive programming problems released after training cutoffs; Vals AI's independent implementation, overall pass@1.

对比来源
Vals AI · LiveCodeBench
版本 / 任务
Vals LiveCodeBench v1 · vals-livecodebench-overall
指标 / 单位
pass_at_1 · percent
基准原始页面 ↗
SciCode

通过可执行 Python 测试的子问题准确率衡量科学研究编程能力。

对比来源
Epoch AI mirror · SciCode
版本 / 任务
SciCode current leaderboard · scientific-research-coding-subproblems
指标 / 单位
subproblem_accuracy · percent
基准原始页面 ↗
ALE-Bench

Score-based algorithmic optimisation contests (AtCoder Heuristic); performance rating.

对比来源
Epoch AI mirror · ALE-Bench
版本 / 任务
ALE-Bench current leaderboard · atcoder-heuristic-contest-set
指标 / 单位
performance_rating · points
基准原始页面 ↗
Vibe Code Bench

Building complete web applications from scratch in an agent harness, evaluated by Vals AI.

对比来源
Vals AI · Vibe Code Bench
版本 / 任务
Vals Vibe Code Bench v1.1 · vals-vibe-code-bench-overall
指标 / 单位
score · percent
基准原始页面 ↗
Text Arena · Coding

对使用 React 和 TypeScript 生成的 Web 应用进行人类偏好评分。

对比来源
Epoch AI mirror · Text Arena (Coding)
版本 / 任务
Text Arena Coding current pool · text-arena-coding-bradley-terry
指标 / 单位
bradley_terry_rating · points
基准原始页面 ↗
WeirdML

Unusual machine-learning tasks solved end-to-end by writing and running code.

对比来源
Epoch AI mirror · WeirdML
版本 / 任务
WeirdML v2 current leaderboard · weirdml-v2-task-set
指标 / 单位
accuracy · percent
基准原始页面 ↗

智能体与工具

Terminal-Bench 2.0

Terminal-Bench 2.0 leaderboard over 89 hard terminal tasks; agent harness and run date stay attached to every score.

对比来源
Epoch AI mirror · Terminal-Bench 2.0
版本 / 任务
Terminal-Bench 2.0 · official-89-task-set
指标 / 单位
accuracy_mean · percent
基准原始页面 ↗
Terminal-Bench 2.1

Vals AI's independent Terminal-Bench 2.1 run with one uniform harness; vendor reports remain supplemental.

对比来源
Vals AI · Terminal-Bench 2.1
版本 / 任务
Vals Terminal-Bench 2.1 v2.1 · vals-terminal-bench-2-1-overall
指标 / 单位
accuracy · percent
基准原始页面 ↗
Terminal-Bench 3.0

智能体与模型在 74 项高难终端任务上的官方排名;每个分数保留智能体、推理强度和试验次数。

对比来源
Terminal-Bench 3.0
版本 / 任务
3.0 · b936386b-4afd-4ad7-aa7f-6b52bcab9853 · official-74-task-leaderboard
指标 / 单位
accuracy · percent
基准原始页面 ↗
τ³-Banking · Official harness

需要检索、工具和模拟用户的知识密集型多轮银行支持任务,取自官方排行榜。

对比来源
τ³-Banking
版本 / 任务
1.0.1 · banking_knowledge
指标 / 单位
pass_1 · percent
基准原始页面 ↗
τ³-Banking · Artificial Analysis harness

Artificial Analysis 对同一领域的自有测评:97 项任务、BM25/grep 检索,以及不同的模拟用户。模拟器本身就是测量的一部分,因此这是独立的一列,而非第二种意见。

对比来源
Artificial Analysis · Intelligence Index evaluations
版本 / 任务
τ³-Banking (Artificial Analysis) · banking-97-tasks-gpt-5-4-mini-simulator
指标 / 单位
pass_at_1 · percent
基准原始页面 ↗
MCP-Atlas · Scale

Real-world multi-step tool use across 1,000 tasks, 36 MCP servers and 220 tools. The comparable lane uses Scale's April 2026 rescored protocol, all public and private tasks, a 100-tool-call budget and the exact row-specific publication date.

对比来源
Scale AI Labs · MCP-Atlas
版本 / 任务
MCP-Atlas April 2026 rescored protocol · all-1000-public-500-private-500
指标 / 单位
pass_rate · percent
基准原始页面 ↗
SkillsBench v1.1

涵盖 87 项专业任务的经审核智能体基准;有技能和无技能协议保持分离。

对比来源
SkillsBench v1.1
版本 / 任务
v1.1 · official-87-tasks-with-skills
指标 / 单位
pass_rate · percent
基准原始页面 ↗
APEX-Agents

使用办公工具和代码执行完成银行、咨询与法律领域的长时程专业任务。

对比来源
Epoch AI mirror · APEX-Agents
版本 / 任务
APEX-Agents current leaderboard · 480-professional-tasks-33-worlds
指标 / 单位
pass_at_1 · percent
基准原始页面 ↗
Berkeley Function Calling Leaderboard V4

BFCL V4 官方评测中的函数调用、多轮工具使用和抗幻觉能力。

对比来源
BFCL V4
版本 / 任务
v4-ede5081a24bc · overall
指标 / 单位
overall_accuracy · percent
基准原始页面 ↗
LMArena Agent Arena

Human preference evaluation of agent outcomes. Every score retains the submitted model, disclosed thinking label, confidence interval and observation count.

对比来源
LMArena Agent Arena
版本 / 任务
2026-09-30 · overall-ips-aggregate
指标 / 单位
ips_score · ips
基准原始页面 ↗
AppWorld

Interactive coding-agent benchmark across controllable applications and APIs; model, method, scaffold and task/scenario metrics remain attached to each run.

对比来源
AppWorld official leaderboard
版本 / 任务
official-c1f56015cf7c · test-challenge-all
指标 / 单位
task_goal_completion · percent
基准原始页面 ↗
Vending-Bench 2

Long-horizon business simulation: mean final balance in USD after a simulated year.

对比来源
Epoch AI mirror · Vending-Bench 2
版本 / 任务
Vending-Bench 2 current leaderboard · one-simulated-year-mean-final-balance
指标 / 单位
mean_final_balance_usd · USD
基准原始页面 ↗
GDPval-AA v2.1

Successor of GDPval-AA v2: the same 220 tasks and judges, Elo refitted and pinned to DeepSeek V4.1 Flash (max) at 1600 - not comparable with v2 values.

对比来源
Artificial Analysis · Intelligence Index evaluations
版本 / 任务
GDPval-AA v2.1 (Crowd-BT Elo, DeepSeek V4.1 Flash (max) at 1600) · 220-tasks-elo-v2-1
指标 / 单位
elo · points
基准原始页面 ↗

数据究竟能说明什么?

我们关注的不只是哪个模型得分更高。这些分析说明哪些比较有证据支持、哪里缺少测量,以及哪些结论超出了数据能够支持的范围。

指标与对比表使用同一份数据快照计算。解读由 LLM Benchmarks 提供,测量来自注明的来源。

如何使用这些分析

模型选择和已发布测试的可用性都会影响分析。证据更多首先意味着有更多可核查的信息,并不自动代表模型更好。因此,每项分析都会说明计数单位、数据时间和局限。分析随公开数据集重新计算,不是对原始测试的独立复现。

阅读具体模型比较与案例 →

01

小型开放模型:比较有多少证据支持?

选择小型开放模型,需要的不只是单个高分。对于收录的总参数量低于 360 亿的开放模型,我们检查有多少模型与基准组合具备证据,以及其中哪些可以直接比较。

较广的覆盖有助于初选。它衡量可用证据,不是模型质量排名,也不代表内存需求。

可用证据有多少?

一个组合由完整对比表中的一个模型和一个基准构成。多个思考强度只计一次,量化研究不计作基础模型的证据。“可比较”要求至少存在一个无冲突且具有表格可比状态的结果。统计包含所有已记录的基础模型配置,不只包含当前筛选视图。

11所选模型
171 / 506有记录的模型与基准组合
100其中具有可比证据
按任务领域划分的证据覆盖率

每个条形包含该领域的全部可能组合。数字依次为:可比较 / 有记录 / 全部可能。

综合19 / 19 / 44
知识与推理34 / 71 / 165
编程27 / 46 / 154
智能体与工具20 / 35 / 143
可比较证据仅有其他证据无已记录证据

根据公开导出数据自行统计。数据日期: . JSON · CSV

这对模型选择意味着什么?

先寻找与你的任务领域相关的证据。大量知识测量无法填补编程智能体评测的空缺。随后比较候选模型共有的基准,并核查协议。未知的总参数量不会根据模型名称推断,也不能因此纳入低于 360 亿参数的分析。

图中的浅色部分是我们数据中的信息空缺。模型可能已在其他地方被评测,只是我们没有可发布的记录。模型本身也经过筛选。因此,这些条形不能证明开放或闭源模型具有普遍优势。

如何复现分析

在 JSON 导出中,筛选总参数量有据可查、大于零且低于 360 亿的开放模型。仅统计网站中的基准。按模型和基准合并基础模型证据,量化版本单独处理。数据包括仍符合发布条件的较旧结果。在决定实际使用前,还应查看每次测量的日期。

02

相同基准,不同条件

两个已发布分数可能都正确,却不适合计算公平的差值。我们统计具有可比证据的模型与基准组合,并结合评测口径解释区别。

都测过同一基准,不自动意味着可以直接比较。计算差值前,版本、任务和配置必须一致。

有记录不总是意味着可比较

分析统计所有选定模型与网站基准的组合。只要存在至少一个基础模型结果,就算有记录。可比较组合还需要至少一个无冲突且具有对应表格状态的结果。其余组合只有补充证据或其他无法直接比较的证据。思考强度版本不会重复计数。

100所选模型
2,221 / 4,600有记录的模型与基准组合
1,991其中具有可比证据
按任务领域划分的证据覆盖率

每个条形包含该领域的全部可能组合。数字依次为:可比较 / 有记录 / 全部可能。

综合275 / 275 / 400
知识与推理705 / 816 / 1,500
编程589 / 683 / 1,400
智能体与工具422 / 447 / 1,300
可比较证据仅有其他证据无已记录证据

根据公开导出数据自行统计。数据日期: . JSON · CSV

三种差值可能误导的情况

SWE-bench:一个模型运行在厂商智能体中,另一个运行在统一评测框架中,首先代表的是两个系统。我们的 Verified 严格比较使用指定的 Vals 口径。对于 Pro,系统报告结果与直接可比口径保持分开。

HLE:完整任务集与纯文本子集使用不同的分母。工具使用也改变允许的解题方法。在这些配置之间计算百分点差值,无法单独反映模型改进。

SWE-rebench:任务窗口变化会改变需要解决的问题。较旧且有记录的窗口可以形成自己的比较组。其排名属于该窗口,不应等同于当前窗口的排名。

三步完成有依据的比较

选择二至四个模型和一个相关领域。将视图限制为所有所选模型都测过的基准。随后查看可比性标注和测量详情,再解读相对于参考模型的差值。即使差值在技术上成立,也不是统计显著性检验。

我们的结论:额外的厂商结果会增加信息,但不会自动生成另一个公平排名。明确这一点,比把所有可用分数强行放进一个排名更有帮助。

03

更多思考不保证更高分数

更多计算常被等同于更好的结果。我们在公开数据中寻找有记录的例子:在相同已披露评测配置下,更高的固定思考强度反而获得更低分数。

反例挑战的是“必然提升”的假设,并不说明较少思考通常更好。

当前数据快照中的例子

我们在相同模型、来源、测试版本、任务集、指标、工具、智能体编排和评测流程下比较已记录的固定强度。披露的样本数也必须一致。只使用规范对比口径中近期、有效且没有冲突或污染警告的证据。同一强度下存在含义不明确的多个分数时会排除。

Claude Fable 5.1 · CritPt
xhigh31.1 %
max29.7 %

CritPt current leaderboard · Epoch AI mirror · CritPt

证据日期依据: 2026年9月2日 / 2026年9月2日. 不能证明思考强度的因果影响。

Claude Fable 5 · Vending 2
high5680.26 USD
max4966.64 USD

Vending-Bench 2 current leaderboard · Epoch AI mirror · Vending-Bench 2

证据日期依据: 2026年9月2日 / 2026年9月2日. 不能证明思考强度的因果影响。

Claude Opus 4.7 · ARC-AGI-1
high93.5 %
max92.0 %

ARC-AGI-1 current leaderboard · Epoch AI mirror · ARC-AGI-1

证据日期依据: 2026年9月2日 / 2026年9月2日. 不能证明思考强度的因果影响。

这些例子能说明什么?

这些是有意挑选的反例,不是代表性样本,也不是发生频率估计。不同评测时间和未披露设置仍可能产生影响。没有重复试验和适当的不确定性分析,就无法确定分差的原因。

因此,表格默认采用选定测试系列中已记录的最高强度,而不是事后从所有强度中挑选最高分。这使选择规则可追溯。对于你的应用,应同时测试质量、响应时间和成本;这里的质量分数本身并不构成效率排名。

谁在运营这个网站?

LLM Benchmarks 由 Christopher Böhm 私人运营。项目将已发布的模型评测、来源和局限汇集在一处,便于比较。

比起看似确定的排行榜,我们更重视可追溯的筛选。每项比较都应能追溯到证据。

我们的贡献

我们对应模型身份和基准版本,区分不同测试条件,标注不确定或冲突的信息,并提供比较和导出工具。说明与分析让这些决定更容易理解。我们不会把第三方测量称为自己的测试。

责任与维护

Christopher Böhm 是运营者和联系人。数据采集和技术检查部分自动化。项目维护发布规则、来源归属和经过筛选的补充证据。自动化也可能传播错误,因此来源链接、测量详情和更正联系方式都是服务的一部分。

资金支持与筛选规则

运营者通过 PayPal 接受自愿支持。网站也已为手动设置的 AdSense 广告位做好准备。模型收录、测量选择和排名遵循方法说明中的数据规则。来源标注用于记录结果出处,并不构成产品推荐。

联系与更正

发现错误分数、模型对应错误或遗漏的限制了吗?请发送模型名称、基准、相关信息,并尽可能附上原始证据。我们也欢迎提供尚未收录的已发布测试。请勿发送机密数据。