LLM Benchmarks

有来源依据的测量结果

比较 100 个 AI 模型的综合能力、知识、编程与智能体表现,提供来源、测试日期和透明的比较规则。

基准
模型
筛选
模型
单元格视图
数据质量
模型对比
可选模型:100
显示 100/100 个模型 · 16 项基准
读懂表格
搜索模型 · 点击列名排序 · 点击分数查看来源 左线:绿色为最新 · 蓝色为当前 · 3 个月后为赭色≡ 并列名次:领先幅度不足一道已解答题目#3/13 窗口名次:仅在其所属的任务窗口内有效Date 日期标签 = 日期依据S·A+ 来源权威性:A+ 最高 · A 强 · B 可靠 · C 有限T·Max 最高实测推理强度16 16 项基准,每个领域 4 项。选择分类可查看该领域的全部测试。排名与颜色依据每项基准中所有可排名的模型,包括隐藏模型。十项及以上使用五档,较小组保持中性色。这些排名由数据推导,并非来源测量值。ORG 基准主办方 · PROV 模型提供商 · 3P 官方跨提供商比较 可靠来源对同一披露协议给出不同结果 在相同协议下可直接比较,但可能存在基准污染 不同协议可衡量的质量目标可比单元格:90% · 目标 ≥85%近期核心值:86% · 目标 ≥90%覆盖 ≥60 个模型的核心列:6/16
分享与导出

每种测试配置显示已披露的最高推理强度,但它不一定取得最高分。不同提供商的级别不代表相同计算预算。

最近一次已验证更新 评分和表格无实质变化打开机器可读的变更订阅源
单元格视图
前 10%前 25%中游后四分之一末位排名与颜色以每项基准的全部模型为依据。模型筛选仅隐藏行。最高实测推理强度
100 个语言模型的最新可追溯结果。各列可排序。可比数值参与排名;SWE-Pro 还可排序明确标注的官方系统成绩,并用 ≈ 保留协议差异提示。
综合知识与推理编程智能体与工具
⁨ECI⁩ 排名 ↓ · 模型ECI, 综合, Epoch Capabilities Index: 82/100 已测模型; 82 可比. 规范协议: Epoch ECI snapshot 2026-10-01 · official-composite-fit · Epoch Capabilities Index. 可比值从高到低.说明AA Index, 综合, Artificial Analysis Intelligence Index: 58/100 已测模型; 58 可比, 1 个并列名次. 规范协议: Artificial Analysis Intelligence Index v4.3 · intelligence-index-v4-3 · Artificial Analysis · Intelligence Index evaluations. 排序.说明Arena, 综合, Arena Text: 80/100 已测模型; 80 可比, 23 个并列名次. 规范协议: 2026-09-30 · overall-style-control · Arena Text. 排序.说明LiveBench, 综合, LiveBench: 55/100 已测模型; 55 可比. 规范协议: 2026-06-25 · overall-seven-category · LiveBench. 排序.说明HLE Full, 知识与推理, Humanity's Last Exam · Full multimodal: 54/100 已测模型; 16 可比, 其中 38 个采用不同协议, 1 个并列名次. 规范协议: HLE finalized 2,500 · Scale protocol 2025-04-03 · full-multimodal-2500-no-tools · Scale AI Labs · Humanity's Last Exam Full. 排序.说明GPQA, 知识与推理, GPQA Diamond: 89/100 已测模型; 56 可比, 其中 33 个采用不同协议, 27 个并列名次. 规范协议: GPQA Diamond v1 · Vals dual-prompt · diamond-198-zero-and-five-shot-cot · Vals AI GPQA Diamond. 排序.说明MMLU-Pro, 知识与推理, MMLU-Pro: 66/100 已测模型; 57 可比, 其中 9 个采用不同协议, 14 个并列名次. 规范协议: Vals MMLU-Pro v1 · vals-mmlu-pro-overall · Vals AI · MMLU-Pro. 排序.说明FrontierMath T1–3, 知识与推理, FrontierMath T1–3: 64/100 已测模型; 64 可比, 16 个并列名次. 规范协议: 2.0.0 · private-285-of-295-problem-tiers-1-3-set · Epoch AI · FrontierMath Tiers 1–3 v2. 排序.说明SWE-bench, 编程, SWE-bench Verified: 60/100 已测模型; 60 可比, 18 个并列名次. 规范协议: SWE-bench Verified v1 · verified-500-vals-mini-swe-agent · Vals AI SWE-bench Verified. 仅显示 Vals AI 使用 mini-swe-agent 与 Bash 完成的统一 500 任务评测。这是默认的直接可比视图。 排序.说明SWE-rebench, 编程, SWE-rebench v2: 38/100 已测模型; 13 可比, 8 个可直接比较并带有污染警告, 其中 25 个采用不同协议. 规范协议: rolling-v2 · 2026-05-15/2026-07-01 · SWE-rebench. 显示最新的共同 SWE-rebench 任务时间窗。污染风险警告仍会保留。 2026-05-15/2026-07-01 排序.说明LiveCodeBench, 编程, LiveCodeBench: 63/100 已测模型; 55 可比, 其中 8 个采用不同协议, 8 个并列名次. 规范协议: Vals LiveCodeBench v1 · vals-livecodebench-overall · Vals AI · LiveCodeBench. 排序.说明SciCode, 编程, SciCode: 79/100 已测模型; 70 可比, 其中 9 个采用不同协议, 8 个并列名次. 规范协议: SciCode current leaderboard · scientific-research-coding-subproblems · Epoch AI mirror · SciCode. 排序.说明Terminal 2.1, 智能体与工具, Terminal-Bench 2.1: 67/100 已测模型; 58 可比, 其中 9 个采用不同协议, 12 个并列名次. 规范协议: Vals Terminal-Bench 2.1 v2.1 · vals-terminal-bench-2-1-overall · Vals AI · Terminal-Bench 2.1. 排序.说明MCP-Atlas, 智能体与工具, MCP-Atlas · Scale: 24/100 已测模型; 23 可比, 其中 1 个采用不同协议, 2 个并列名次. 规范协议: MCP-Atlas April 2026 rescored protocol · all-1000-public-500-private-500 · Scale AI Labs · MCP-Atlas. 排序.说明APEX, 智能体与工具, APEX-Agents: 53/100 已测模型; 53 可比, 3 个并列名次. 规范协议: APEX-Agents current leaderboard · 480-professional-tasks-33-worlds · Epoch AI mirror · APEX-Agents. 排序.说明GDPval-AA v2.1, 智能体与工具, GDPval-AA v2.1: 76/100 已测模型; 76 可比, 2 个并列名次. 规范协议: GDPval-AA v2.1 (Crowd-BT Elo, DeepSeek V4.1 Flash (max) at 1600) · 220-tasks-elo-v2-1 · Artificial Analysis · Intelligence Index evaluations. 排序.说明
排名 1Claude Opus 5.5Anthropic10/16 项已测 · 9 项可比较
排名 2GPT 6 astraOpenAI11/16 项已测 · 10 项可比较
排名 3Claude Sonnet 5.5Anthropic9/16 项已测 · 8 项可比较
排名 4Claude Fable 5.1Anthropic13/16 项已测 · 12 项可比较
排名 5Claude Opus 5Anthropic16/16 项已测 · 15 项可比较
排名 6GPT 5.5 ProOpenAI3/16 项已测 · 2 项可比较
排名 7Claude Fable 5Anthropic15/16 项已测 · 15 项可比较
排名 8GPT 5.6 SolOpenAI15/16 项已测 · 15 项可比较
排名 9GPT 5.6 TerraOpenAI13/16 项已测 · 13 项可比较
排名 10GPT 5.5OpenAI15/16 项已测 · 13 项可比较
排名 11GPT 5.4 ProOpenAI4/16 项已测 · 3 项可比较
排名 12Claude Opus 4.8Anthropic15/16 项已测 · 13 项可比较
排名 13Kimi K3Moonshot AI15/16 项已测 · 14 项可比较
排名 14Gemini 3.7 FlashGoogle13/16 项已测 · 13 项可比较
排名 15Gemini 3.8 FlashGoogle14/16 项已测 · 14 项可比较
排名 16GPT 5.4OpenAI14/16 项已测 · 13 项可比较
排名 17Muse Spark 1 3Meta10/16 项已测 · 9 项可比较
排名 18GPT 5.3 CodexOpenAI7/16 项已测 · 5 项可比较
排名 19Grok 4.6xAI13/16 项已测 · 13 项可比较
排名 20Qwen 3.8 MaxAlibaba12/16 项已测 · 12 项可比较
排名 21GPT 5.6 LunaOpenAI12/16 项已测 · 12 项可比较
排名 22Claude Opus 4.7Anthropic15/16 项已测 · 14 项可比较
排名 23Claude Sonnet 5Anthropic15/16 项已测 · 14 项可比较
排名 24GLM 5.3Z.ai14/16 项已测 · 13 项可比较
排名 25GPT 5.2 ProOpenAI2/16 项已测 · 2 项可比较
排名 26DeepSeek V4 Pro (2026-08-13)DeepSeek14/16 项已测 · 13 项可比较
排名 27Claude Opus 4.6Anthropic12/16 项已测 · 11 项可比较
排名 28Qwen 3.8 Max (0902)Alibaba6/16 项已测 · 5 项可比较
排名 29DeepSeek V4.1 FlashDeepSeek8/16 项已测 · 7 项可比较
排名 30Muse Spark 1.2Meta11/16 项已测 · 10 项可比较
排名 31Gemini 3.1 ProGoogle16/16 项已测 · 15 项可比较
排名 32DeepSeek V4 Flash (2026-07-31)DeepSeek12/16 项已测 · 11 项可比较
排名 33Gemini 3.5 FlashGoogle16/16 项已测 · 14 项可比较
排名 34Gemini 3.6 FlashGoogle13/16 项已测 · 13 项可比较
排名 35Muse Spark 1.1Meta13/16 项已测 · 12 项可比较
排名 36Grok 4.5xAI14/16 项已测 · 14 项可比较
排名 37Qwen 3.7 MaxAlibaba11/16 项已测 · 11 项可比较
排名 38GPT 5.2OpenAI11/16 项已测 · 10 项可比较
排名 39Gemini 3 ProGoogle10/16 项已测 · 9 项可比较
排名 40Claude Sonnet 4.6Anthropic15/16 项已测 · 13 项可比较
排名 41Muse SparkMeta9/16 项已测 · 9 项可比较
排名 42Grok 4.20xAI8/16 项已测 · 8 项可比较
排名 43GLM 5.3 FlashZ.ai14/16 项已测 · 13 项可比较
排名 44Gemini 3 FlashGoogle11/16 项已测 · 9 项可比较
排名 45GLM 5.2Z.ai744B · 40B 激活16/16 项已测 · 15 项可比较
排名 46Kimi K2.6Moonshot AI1T · 32B 激活14/16 项已测 · 12 项可比较
排名 47GPT 5 ProOpenAI3/16 项已测 · 3 项可比较
排名 48Inkling SmallThinking Machines Lab276B · 12B 激活13/16 项已测 · 12 项可比较
排名 49Claude Opus 4.5Anthropic11/16 项已测 · 10 项可比较
排名 50Kimi K2.7 CodeMoonshot AI1T · 32B 激活11/16 项已测 · 10 项可比较
排名 51GPT 5OpenAI11/16 项已测 · 10 项可比较
排名 52GLM 5.1Z.ai744B · 40B 激活14/16 项已测 · 12 项可比较
排名 53GPT 5.1OpenAI10/16 项已测 · 10 项可比较
排名 54Qwen 3.8 27BAlibaba27B12/16 项已测 · 11 项可比较
排名 55Qwen 3.6 Max PreviewAlibaba4/16 项已测 · 3 项可比较
排名 56Grok 4.3xAI13/16 项已测 · 12 项可比较
排名 57DeepSeek V4 Pro (2026-04-22)DeepSeek1.6T · 49B 激活14/16 项已测 · 13 项可比较
排名 58GPT 5.4 MiniOpenAI12/16 项已测 · 12 项可比较
排名 59InklingThinking Machines Lab975B · 41B 激活15/16 项已测 · 14 项可比较
排名 60Kimi K2.5Moonshot AI1T · 32B 激活12/16 项已测 · 11 项可比较
排名 61Qwen 3.6 PlusAlibaba11/16 项已测 · 11 项可比较
排名 62Qwen 3.7 PlusAlibaba9/16 项已测 · 7 项可比较
排名 63MiniMax M3MiniMax14/16 项已测 · 13 项可比较
排名 64Claude Sonnet 4.5Anthropic12/16 项已测 · 11 项可比较
排名 65Qwen 3.5 397B-A17BAlibaba397B · 17B 激活12/16 项已测 · 6 项可比较
排名 66Qwen 3.6 27BAlibaba27B13/16 项已测 · 8 项可比较
排名 67DeepSeek V4 Flash (2026-04-22)DeepSeek284B · 13B 激活9/16 项已测 · 5 项可比较
排名 68GLM 5Z.ai9/16 项已测 · 7 项可比较
排名 69GPT 5.4 NanoOpenAI12/16 项已测 · 12 项可比较
排名 70Gemini 2.5 ProGoogle9/16 项已测 · 7 项可比较
排名 71Gemini 3.5 Flash LiteGoogle12/16 项已测 · 12 项可比较
排名 72Gemini 3.1 Flash LiteGoogle13/16 项已测 · 13 项可比较
排名 73Claude Opus 4.1Anthropic7/16 项已测 · 6 项可比较
排名 74Qwen 3.6 35B-A3BAlibaba35B · 3B 激活11/16 项已测 · 6 项可比较
排名 75Gemma 4 31B ITGoogle30.7B6/16 项已测 · 2 项可比较
排名 76Qwen 3.5 35B-A3BAlibaba35B · 3B 激活11/16 项已测 · 6 项可比较
排名 77GPT 5.5 InstantOpenAI5/16 项已测 · 4 项可比较
排名 78mistral Medium 3.5Mistral AI9/16 项已测 · 8 项可比较
排名 79Qwen 3.5 9BAlibaba9B8/16 项已测 · 4 项可比较
排名 80Qwen 3 32BAlibaba32.8B5/16 项已测 · 4 项可比较
排名 81Qwen 3 14BAlibaba14.8B4/16 项已测 · 3 项可比较
排名 82GPT 4.5OpenAI2/16 项已测 · 2 项可比较
18 个模型没有可直接比较的 ECI 分数
无排名Gemini 4 argonGoogle4/16 项已测 · 3 项可比较
无排名GPT 6 SolOpenAI9/16 项已测 · 8 项可比较
无排名Grok 4.7xAI6/16 项已测 · 6 项可比较
无排名GPT 6 LunaOpenAI9/16 项已测 · 8 项可比较
无排名MiMo V2.6 ProXiaomi5/16 项已测 · 4 项可比较
无排名GLM 5.3 MaxZ.ai1/16 项已测 · 1 项可比较
无排名GPT 5.2 Chat Latest (2026-02-10)OpenAI1/16 项已测 · 1 项可比较
无排名MiMo V2.5 ProXiaomi11/16 项已测 · 10 项可比较
无排名HY3Tencent7/16 项已测 · 3 项可比较
无排名Grok 4.1xAI2/16 项已测 · 2 项可比较
无排名Qwen 3.5 27BAlibaba27B6/16 项已测 · 1 项可比较
无排名Qwen 3.8 Flash NextAlibaba125B · 6B 激活7/16 项已测 · 3 项可比较
无排名Gemma 4 12B ITGoogle12B4/16 项已测 · 0 项可比较
无排名Gemma 4 26B-A4B ITGoogle25.2B · 3.8B 激活4/16 项已测 · 0 项可比较
无排名Qwen 3.8 2.4T-A95BAlibaba2.4T · 95B 激活6/16 项已测 · 3 项可比较
无排名MiMo V2.6 FlashXiaomi5/16 项已测 · 4 项可比较
无排名GPT 6.1 SolOpenAI7/16 项已测 · 6 项可比较
无排名Gemma 4 31BGoogle7/16 项已测 · 3 项可比较