LLM Benchmarks
Mesures étayées par des sources
Comparez 100 modèles d’IA en capacités générales, connaissances, code et agents, avec sources, dates des tests et règles de comparaison transparentes.
| Vue d’ensemble | Connaissances et raisonnement | Code | Agents et outils | |||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Rang ECI ↓ · Modèle | ECI, Vue d’ensemble, Epoch Capabilities Index: 82/100 modèles mesurés; 82 comparables. Protocole canonique: Epoch ECI snapshot 2026-10-01 · official-composite-fit · Epoch Capabilities Index. Meilleurs comparables d’abord.Infos | AA Index, Vue d’ensemble, Artificial Analysis Intelligence Index: 58/100 modèles mesurés; 58 comparables, 1 rangs partagés. Protocole canonique: Artificial Analysis Intelligence Index v4.3 · intelligence-index-v4-3 · Artificial Analysis · Intelligence Index evaluations. Trier.Infos | Arena, Vue d’ensemble, Arena Text: 80/100 modèles mesurés; 80 comparables, 23 rangs partagés. Protocole canonique: 2026-09-30 · overall-style-control · Arena Text. Trier.Infos | LiveBench, Vue d’ensemble, LiveBench: 55/100 modèles mesurés; 55 comparables. Protocole canonique: 2026-06-25 · overall-seven-category · LiveBench. Trier.Infos | HLE Full, Connaissances et raisonnement, Humanity's Last Exam · Full multimodal: 54/100 modèles mesurés; 16 comparables, 38 avec un protocole différent, 1 rangs partagés. Protocole canonique: HLE finalized 2,500 · Scale protocol 2025-04-03 · full-multimodal-2500-no-tools · Scale AI Labs · Humanity's Last Exam Full. Trier.Infos | GPQA, Connaissances et raisonnement, GPQA Diamond: 89/100 modèles mesurés; 56 comparables, 33 avec un protocole différent, 27 rangs partagés. Protocole canonique: GPQA Diamond v1 · Vals dual-prompt · diamond-198-zero-and-five-shot-cot · Vals AI GPQA Diamond. Trier.Infos | MMLU-Pro, Connaissances et raisonnement, MMLU-Pro: 66/100 modèles mesurés; 57 comparables, 9 avec un protocole différent, 14 rangs partagés. Protocole canonique: Vals MMLU-Pro v1 · vals-mmlu-pro-overall · Vals AI · MMLU-Pro. Trier.Infos | FrontierMath T1–3, Connaissances et raisonnement, FrontierMath T1–3: 64/100 modèles mesurés; 64 comparables, 16 rangs partagés. Protocole canonique: 2.0.0 · private-285-of-295-problem-tiers-1-3-set · Epoch AI · FrontierMath Tiers 1–3 v2. Trier.Infos | SWE-bench, Code, SWE-bench Verified: 60/100 modèles mesurés; 60 comparables, 18 rangs partagés. Protocole canonique: SWE-bench Verified v1 · verified-500-vals-mini-swe-agent · Vals AI SWE-bench Verified. Affiche uniquement l’évaluation uniforme de Vals AI sur 500 tâches avec mini-swe-agent et Bash. C’est la vue directement comparable par défaut. Trier.Infos | SWE-rebench, Code, SWE-rebench v2: 38/100 modèles mesurés; 13 comparables, 8 directement comparables avec un avertissement de contamination, 25 avec un protocole différent. Protocole canonique: rolling-v2 · 2026-05-15/2026-07-01 · SWE-rebench. Affiche la fenêtre de tâches SWE-rebench commune la plus récente. Les avertissements de contamination restent visibles. 2026-05-15/2026-07-01 Trier.Infos | LiveCodeBench, Code, LiveCodeBench: 63/100 modèles mesurés; 55 comparables, 8 avec un protocole différent, 8 rangs partagés. Protocole canonique: Vals LiveCodeBench v1 · vals-livecodebench-overall · Vals AI · LiveCodeBench. Trier.Infos | SciCode, Code, SciCode: 79/100 modèles mesurés; 70 comparables, 9 avec un protocole différent, 8 rangs partagés. Protocole canonique: SciCode current leaderboard · scientific-research-coding-subproblems · Epoch AI mirror · SciCode. Trier.Infos | Terminal 2.1, Agents et outils, Terminal-Bench 2.1: 67/100 modèles mesurés; 58 comparables, 9 avec un protocole différent, 12 rangs partagés. Protocole canonique: Vals Terminal-Bench 2.1 v2.1 · vals-terminal-bench-2-1-overall · Vals AI · Terminal-Bench 2.1. Trier.Infos | MCP-Atlas, Agents et outils, MCP-Atlas · Scale: 24/100 modèles mesurés; 23 comparables, 1 avec un protocole différent, 2 rangs partagés. Protocole canonique: MCP-Atlas April 2026 rescored protocol · all-1000-public-500-private-500 · Scale AI Labs · MCP-Atlas. Trier.Infos | APEX, Agents et outils, APEX-Agents: 53/100 modèles mesurés; 53 comparables, 3 rangs partagés. Protocole canonique: APEX-Agents current leaderboard · 480-professional-tasks-33-worlds · Epoch AI mirror · APEX-Agents. Trier.Infos | GDPval-AA v2.1, Agents et outils, GDPval-AA v2.1: 76/100 modèles mesurés; 76 comparables, 2 rangs partagés. Protocole canonique: GDPval-AA v2.1 (Crowd-BT Elo, DeepSeek V4.1 Flash (max) at 1600) · 220-tasks-elo-v2-1 · Artificial Analysis · Intelligence Index evaluations. Trier.Infos |
| Rang 1Claude Opus 5.510/16 mesurés · 9 comparables | ||||||||||||||||
| Rang 2GPT 6 astra11/16 mesurés · 10 comparables | ||||||||||||||||
| Rang 3Claude Sonnet 5.59/16 mesurés · 8 comparables | ||||||||||||||||
| Rang 4Claude Fable 5.113/16 mesurés · 12 comparables | ||||||||||||||||
| Rang 5Claude Opus 516/16 mesurés · 15 comparables | ||||||||||||||||
| Rang 6GPT 5.5 Pro3/16 mesurés · 2 comparables | ||||||||||||||||
| Rang 7Claude Fable 515/16 mesurés · 15 comparables | ||||||||||||||||
| Rang 8GPT 5.6 Sol15/16 mesurés · 15 comparables | ||||||||||||||||
| Rang 9GPT 5.6 Terra13/16 mesurés · 13 comparables | ||||||||||||||||
| Rang 10GPT 5.515/16 mesurés · 13 comparables | ||||||||||||||||
| Rang 11GPT 5.4 Pro4/16 mesurés · 3 comparables | ||||||||||||||||
| Rang 12Claude Opus 4.815/16 mesurés · 13 comparables | ||||||||||||||||
| Rang 13Kimi K315/16 mesurés · 14 comparables | ||||||||||||||||
| Rang 14Gemini 3.7 Flash13/16 mesurés · 13 comparables | ||||||||||||||||
| Rang 15Gemini 3.8 Flash14/16 mesurés · 14 comparables | ||||||||||||||||
| Rang 16GPT 5.414/16 mesurés · 13 comparables | ||||||||||||||||
| Rang 17Muse Spark 1 310/16 mesurés · 9 comparables | ||||||||||||||||
| Rang 18GPT 5.3 Codex7/16 mesurés · 5 comparables | ||||||||||||||||
| Rang 19Grok 4.613/16 mesurés · 13 comparables | ||||||||||||||||
| Rang 20Qwen 3.8 Max12/16 mesurés · 12 comparables | ||||||||||||||||
| Rang 21GPT 5.6 Luna12/16 mesurés · 12 comparables | ||||||||||||||||
| Rang 22Claude Opus 4.715/16 mesurés · 14 comparables | ||||||||||||||||
| Rang 23Claude Sonnet 515/16 mesurés · 14 comparables | ||||||||||||||||
| Rang 24GLM 5.314/16 mesurés · 13 comparables | ||||||||||||||||
| Rang 25GPT 5.2 Pro2/16 mesurés · 2 comparables | ||||||||||||||||
| Rang 26DeepSeek V4 Pro (2026-08-13)14/16 mesurés · 13 comparables | ||||||||||||||||
| Rang 27Claude Opus 4.612/16 mesurés · 11 comparables | ||||||||||||||||
| Rang 28Qwen 3.8 Max (0902)6/16 mesurés · 5 comparables | ||||||||||||||||
| Rang 29DeepSeek V4.1 Flash8/16 mesurés · 7 comparables | ||||||||||||||||
| Rang 30Muse Spark 1.211/16 mesurés · 10 comparables | ||||||||||||||||
| Rang 31Gemini 3.1 Pro16/16 mesurés · 15 comparables | ||||||||||||||||
| Rang 32DeepSeek V4 Flash (0731)12/16 mesurés · 11 comparables | ||||||||||||||||
| Rang 33Gemini 3.5 Flash16/16 mesurés · 14 comparables | ||||||||||||||||
| Rang 34Gemini 3.6 Flash13/16 mesurés · 13 comparables | ||||||||||||||||
| Rang 35Muse Spark 1.113/16 mesurés · 12 comparables | ||||||||||||||||
| Rang 36Grok 4.514/16 mesurés · 14 comparables | ||||||||||||||||
| Rang 37Qwen 3.7 Max11/16 mesurés · 11 comparables | ||||||||||||||||
| Rang 38GPT 5.211/16 mesurés · 10 comparables | ||||||||||||||||
| Rang 39Gemini 3 Pro10/16 mesurés · 9 comparables | ||||||||||||||||
| Rang 40Claude Sonnet 4.615/16 mesurés · 13 comparables | ||||||||||||||||
| Rang 41Muse Spark9/16 mesurés · 9 comparables | ||||||||||||||||
| Rang 42Grok 4.208/16 mesurés · 8 comparables | ||||||||||||||||
| Rang 43GLM 5.3 Flash14/16 mesurés · 13 comparables | ||||||||||||||||
| Rang 44Gemini 3 Flash11/16 mesurés · 9 comparables | ||||||||||||||||
| Rang 45GLM 5.216/16 mesurés · 15 comparables | ||||||||||||||||
| Rang 46Kimi K2.614/16 mesurés · 12 comparables | ||||||||||||||||
| Rang 47GPT 5 Pro3/16 mesurés · 3 comparables | ||||||||||||||||
| Rang 48Inkling Small13/16 mesurés · 12 comparables | ||||||||||||||||
| Rang 49Claude Opus 4.511/16 mesurés · 10 comparables | ||||||||||||||||
| Rang 50Kimi K2.7 Code11/16 mesurés · 10 comparables | ||||||||||||||||
| Rang 51GPT 511/16 mesurés · 10 comparables | ||||||||||||||||
| Rang 52GLM 5.114/16 mesurés · 12 comparables | ||||||||||||||||
| Rang 53GPT 5.110/16 mesurés · 10 comparables | ||||||||||||||||
| Rang 54Qwen 3.8 27B12/16 mesurés · 11 comparables | ||||||||||||||||
| Rang 55Qwen 3.6 Max Preview4/16 mesurés · 3 comparables | ||||||||||||||||
| Rang 56Grok 4.313/16 mesurés · 12 comparables | ||||||||||||||||
| Rang 57DeepSeek V4 Pro (2026-04-22)14/16 mesurés · 13 comparables | ||||||||||||||||
| Rang 58GPT 5.4 Mini12/16 mesurés · 12 comparables | ||||||||||||||||
| Rang 59Inkling15/16 mesurés · 14 comparables | ||||||||||||||||
| Rang 60Kimi K2.512/16 mesurés · 11 comparables | ||||||||||||||||
| Rang 61Qwen 3.6 Plus11/16 mesurés · 11 comparables | ||||||||||||||||
| Rang 62Qwen 3.7 Plus9/16 mesurés · 7 comparables | ||||||||||||||||
| Rang 63MiniMax M314/16 mesurés · 13 comparables | ||||||||||||||||
| Rang 64Claude Sonnet 4.512/16 mesurés · 11 comparables | ||||||||||||||||
| Rang 65Qwen 3.5 397B-A17B12/16 mesurés · 6 comparables | ||||||||||||||||
| Rang 66Qwen 3.6 27B13/16 mesurés · 8 comparables | ||||||||||||||||
| Rang 67DeepSeek V4 Flash (2026-04-22)9/16 mesurés · 5 comparables | ||||||||||||||||
| Rang 68GLM 59/16 mesurés · 7 comparables | ||||||||||||||||
| Rang 69GPT 5.4 Nano12/16 mesurés · 12 comparables | ||||||||||||||||
| Rang 70Gemini 2.5 Pro9/16 mesurés · 7 comparables | ||||||||||||||||
| Rang 71Gemini 3.5 Flash Lite12/16 mesurés · 12 comparables | ||||||||||||||||
| Rang 72Gemini 3.1 Flash Lite13/16 mesurés · 13 comparables | ||||||||||||||||
| Rang 73Claude Opus 4.17/16 mesurés · 6 comparables | ||||||||||||||||
| Rang 74Qwen 3.6 35B-A3B11/16 mesurés · 6 comparables | ||||||||||||||||
| Rang 75Gemma 4 31B IT6/16 mesurés · 2 comparables | ||||||||||||||||
| Rang 76Qwen 3.5 35B-A3B11/16 mesurés · 6 comparables | ||||||||||||||||
| Rang 77GPT 5.5 Instant5/16 mesurés · 4 comparables | ||||||||||||||||
| Rang 78mistral Medium 3.59/16 mesurés · 8 comparables | ||||||||||||||||
| Rang 79Qwen 3.5 9B8/16 mesurés · 4 comparables | ||||||||||||||||
| Rang 80Qwen 3 32B5/16 mesurés · 4 comparables | ||||||||||||||||
| Rang 81Qwen 3 14B4/16 mesurés · 3 comparables | ||||||||||||||||
| Rang 82GPT 4.52/16 mesurés · 2 comparables | ||||||||||||||||
| 18 modèles sans score ECI directement comparable | ||||||||||||||||
| Aucun rangGemini 4 argon4/16 mesurés · 3 comparables | ||||||||||||||||
| Aucun rangGPT 6 Sol9/16 mesurés · 8 comparables | ||||||||||||||||
| Aucun rangGrok 4.76/16 mesurés · 6 comparables | ||||||||||||||||
| Aucun rangGPT 6 Luna9/16 mesurés · 8 comparables | ||||||||||||||||
| Aucun rangMiMo V2.6 Pro5/16 mesurés · 4 comparables | ||||||||||||||||
| Aucun rangGLM 5.3 Max1/16 mesurés · 1 comparables | ||||||||||||||||
| Aucun rangGPT 5.2 Chat Latest (2026-02-10)1/16 mesurés · 1 comparables | ||||||||||||||||
| Aucun rangMiMo V2.5 Pro11/16 mesurés · 10 comparables | ||||||||||||||||
| Aucun rangHY37/16 mesurés · 3 comparables | ||||||||||||||||
| Aucun rangGrok 4.12/16 mesurés · 2 comparables | ||||||||||||||||
| Aucun rangQwen 3.5 27B6/16 mesurés · 1 comparables | ||||||||||||||||
| Aucun rangQwen 3.8 Flash Next7/16 mesurés · 3 comparables | ||||||||||||||||
| Aucun rangGemma 4 12B IT4/16 mesurés · 0 comparables | ||||||||||||||||
| Aucun rangGemma 4 26B-A4B IT4/16 mesurés · 0 comparables | ||||||||||||||||
| Aucun rangQwen 3.8 2.4T-A95B6/16 mesurés · 3 comparables | ||||||||||||||||
| Aucun rangMiMo V2.6 Flash5/16 mesurés · 4 comparables | ||||||||||||||||
| Aucun rangGPT 6.1 Sol7/16 mesurés · 6 comparables | ||||||||||||||||
| Aucun rangGemma 4 31B7/16 mesurés · 3 comparables | ||||||||||||||||