LLM Benchmarks

Mesures étayées par des sources

Comparez 100 modèles d’IA en capacités générales, connaissances, code et agents, avec sources, dates des tests et règles de comparaison transparentes.

Benchmarks
Modèles
Filtres
Modèles
Vue des cellules
Qualité des données
Comparer les modèles
Modèles disponibles : 100
100 modèles sur 100 · 16 benchmarks
Lire le tableau
Cherchez un modèle · Cliquez sur un en-tête pour trier · Sur un score pour sa source Ligne : vert très récent · bleu actuel · ocre après 3 mois≡ Rang partagé : l’écart est inférieur à une seule tâche résolue#3/13 Place de fenêtre : valable uniquement dans sa propre fenêtre de tâchesDate Libellé de date = fondementS·A+ Autorité de la source : A+ maximale · A forte · B solide · C limitéeT·Max Raisonnement mesuré le plus élevé16 16 benchmarks : quatre par domaine. Choisissez une catégorie pour voir tous ses tests.Rangs et couleurs prennent en compte tous les modèles classables par benchmark, même masqués. Cinq bandes dès dix résultats ; les groupes plus petits restent neutres. Ces rangs sont dérivés, pas des mesures de source.ORG Organisateur du benchmark · PROV Fournisseur du modèle · 3P Comparaison officielle tierce des sources fiables divergent pour le même protocole déclaré directement comparable selon le même protocole, avec contamination possible du benchmark protocole différentObjectifs qualité mesurésCellules comparables : 90% · objectif ≥85%Valeurs essentielles récentes : 86% · objectif ≥90%Colonnes essentielles avec ≥60 modèles : 6/16
Partager et exporter

Pour chaque protocole, nous affichons le niveau de raisonnement documenté le plus élevé. Il ne donne pas toujours le meilleur score. Les niveaux ne représentent pas le même budget de calcul entre fournisseurs.

Dernière actualisation vérifiée Modèles +0/−0 · Mesures +52 · mises à jour 0 · −52 · 0 cellules visibles modifiéesOuvrir le flux de modifications lisible par machine
Vue des cellules
Top 10 %Top 25 %MilieuQuart inférieurFinRangs et couleurs portent sur tous les modèles par benchmark. Les filtres masquent seulement des lignes.Raisonnement mesuré le plus élevé
Résultats récents et sourcés de 100 modèles de langage. Les colonnes sont triables. Les valeurs comparables sont classées ; SWE-Pro peut aussi classer des résultats système officiels clairement identifiés, avec ≈ pour les protocoles différents.
Vue d’ensembleConnaissances et raisonnementCodeAgents et outils
Rang ⁨ECI⁩ ↓ · ModèleECI, Vue d’ensemble, Epoch Capabilities Index: 82/100 modèles mesurés; 82 comparables. Protocole canonique: Epoch ECI snapshot 2026-10-01 · official-composite-fit · Epoch Capabilities Index. Meilleurs comparables d’abord.InfosAA Index, Vue d’ensemble, Artificial Analysis Intelligence Index: 58/100 modèles mesurés; 58 comparables, 1 rangs partagés. Protocole canonique: Artificial Analysis Intelligence Index v4.3 · intelligence-index-v4-3 · Artificial Analysis · Intelligence Index evaluations. Trier.InfosArena, Vue d’ensemble, Arena Text: 80/100 modèles mesurés; 80 comparables, 23 rangs partagés. Protocole canonique: 2026-09-30 · overall-style-control · Arena Text. Trier.InfosLiveBench, Vue d’ensemble, LiveBench: 55/100 modèles mesurés; 55 comparables. Protocole canonique: 2026-06-25 · overall-seven-category · LiveBench. Trier.InfosHLE Full, Connaissances et raisonnement, Humanity's Last Exam · Full multimodal: 54/100 modèles mesurés; 16 comparables, 38 avec un protocole différent, 1 rangs partagés. Protocole canonique: HLE finalized 2,500 · Scale protocol 2025-04-03 · full-multimodal-2500-no-tools · Scale AI Labs · Humanity's Last Exam Full. Trier.InfosGPQA, Connaissances et raisonnement, GPQA Diamond: 89/100 modèles mesurés; 56 comparables, 33 avec un protocole différent, 27 rangs partagés. Protocole canonique: GPQA Diamond v1 · Vals dual-prompt · diamond-198-zero-and-five-shot-cot · Vals AI GPQA Diamond. Trier.InfosMMLU-Pro, Connaissances et raisonnement, MMLU-Pro: 66/100 modèles mesurés; 57 comparables, 9 avec un protocole différent, 14 rangs partagés. Protocole canonique: Vals MMLU-Pro v1 · vals-mmlu-pro-overall · Vals AI · MMLU-Pro. Trier.InfosFrontierMath T1–3, Connaissances et raisonnement, FrontierMath T1–3: 64/100 modèles mesurés; 64 comparables, 16 rangs partagés. Protocole canonique: 2.0.0 · private-285-of-295-problem-tiers-1-3-set · Epoch AI · FrontierMath Tiers 1–3 v2. Trier.InfosSWE-bench, Code, SWE-bench Verified: 60/100 modèles mesurés; 60 comparables, 18 rangs partagés. Protocole canonique: SWE-bench Verified v1 · verified-500-vals-mini-swe-agent · Vals AI SWE-bench Verified. Affiche uniquement l’évaluation uniforme de Vals AI sur 500 tâches avec mini-swe-agent et Bash. C’est la vue directement comparable par défaut. Trier.InfosSWE-rebench, Code, SWE-rebench v2: 38/100 modèles mesurés; 13 comparables, 8 directement comparables avec un avertissement de contamination, 25 avec un protocole différent. Protocole canonique: rolling-v2 · 2026-05-15/2026-07-01 · SWE-rebench. Affiche la fenêtre de tâches SWE-rebench commune la plus récente. Les avertissements de contamination restent visibles. 2026-05-15/2026-07-01 Trier.InfosLiveCodeBench, Code, LiveCodeBench: 63/100 modèles mesurés; 55 comparables, 8 avec un protocole différent, 8 rangs partagés. Protocole canonique: Vals LiveCodeBench v1 · vals-livecodebench-overall · Vals AI · LiveCodeBench. Trier.InfosSciCode, Code, SciCode: 79/100 modèles mesurés; 70 comparables, 9 avec un protocole différent, 8 rangs partagés. Protocole canonique: SciCode current leaderboard · scientific-research-coding-subproblems · Epoch AI mirror · SciCode. Trier.InfosTerminal 2.1, Agents et outils, Terminal-Bench 2.1: 67/100 modèles mesurés; 58 comparables, 9 avec un protocole différent, 12 rangs partagés. Protocole canonique: Vals Terminal-Bench 2.1 v2.1 · vals-terminal-bench-2-1-overall · Vals AI · Terminal-Bench 2.1. Trier.InfosMCP-Atlas, Agents et outils, MCP-Atlas · Scale: 24/100 modèles mesurés; 23 comparables, 1 avec un protocole différent, 2 rangs partagés. Protocole canonique: MCP-Atlas April 2026 rescored protocol · all-1000-public-500-private-500 · Scale AI Labs · MCP-Atlas. Trier.InfosAPEX, Agents et outils, APEX-Agents: 53/100 modèles mesurés; 53 comparables, 3 rangs partagés. Protocole canonique: APEX-Agents current leaderboard · 480-professional-tasks-33-worlds · Epoch AI mirror · APEX-Agents. Trier.InfosGDPval-AA v2.1, Agents et outils, GDPval-AA v2.1: 76/100 modèles mesurés; 76 comparables, 2 rangs partagés. Protocole canonique: GDPval-AA v2.1 (Crowd-BT Elo, DeepSeek V4.1 Flash (max) at 1600) · 220-tasks-elo-v2-1 · Artificial Analysis · Intelligence Index evaluations. Trier.Infos
Rang 1Claude Opus 5.5Anthropic10/16 mesurés · 9 comparables
Rang 2GPT 6 astraOpenAI11/16 mesurés · 10 comparables
Rang 3Claude Sonnet 5.5Anthropic9/16 mesurés · 8 comparables
Rang 4Claude Fable 5.1Anthropic13/16 mesurés · 12 comparables
Rang 5Claude Opus 5Anthropic16/16 mesurés · 15 comparables
Rang 6GPT 5.5 ProOpenAI3/16 mesurés · 2 comparables
Rang 7Claude Fable 5Anthropic15/16 mesurés · 15 comparables
Rang 8GPT 5.6 SolOpenAI15/16 mesurés · 15 comparables
Rang 9GPT 5.6 TerraOpenAI13/16 mesurés · 13 comparables
Rang 10GPT 5.5OpenAI15/16 mesurés · 13 comparables
Rang 11GPT 5.4 ProOpenAI4/16 mesurés · 3 comparables
Rang 12Claude Opus 4.8Anthropic15/16 mesurés · 13 comparables
Rang 13Kimi K3Moonshot AI15/16 mesurés · 14 comparables
Rang 14Gemini 3.7 FlashGoogle13/16 mesurés · 13 comparables
Rang 15Gemini 3.8 FlashGoogle14/16 mesurés · 14 comparables
Rang 16GPT 5.4OpenAI14/16 mesurés · 13 comparables
Rang 17Muse Spark 1 3Meta10/16 mesurés · 9 comparables
Rang 18GPT 5.3 CodexOpenAI7/16 mesurés · 5 comparables
Rang 19Grok 4.6xAI13/16 mesurés · 13 comparables
Rang 20Qwen 3.8 MaxAlibaba12/16 mesurés · 12 comparables
Rang 21GPT 5.6 LunaOpenAI12/16 mesurés · 12 comparables
Rang 22Claude Opus 4.7Anthropic15/16 mesurés · 14 comparables
Rang 23Claude Sonnet 5Anthropic15/16 mesurés · 14 comparables
Rang 24GLM 5.3Z.ai14/16 mesurés · 13 comparables
Rang 25GPT 5.2 ProOpenAI2/16 mesurés · 2 comparables
Rang 26DeepSeek V4 Pro (2026-08-13)DeepSeek14/16 mesurés · 13 comparables
Rang 27Claude Opus 4.6Anthropic12/16 mesurés · 11 comparables
Rang 28Qwen 3.8 Max (0902)Alibaba6/16 mesurés · 5 comparables
Rang 29DeepSeek V4.1 FlashDeepSeek8/16 mesurés · 7 comparables
Rang 30Muse Spark 1.2Meta11/16 mesurés · 10 comparables
Rang 31Gemini 3.1 ProGoogle16/16 mesurés · 15 comparables
Rang 32DeepSeek V4 Flash (0731)DeepSeek12/16 mesurés · 11 comparables
Rang 33Gemini 3.5 FlashGoogle16/16 mesurés · 14 comparables
Rang 34Gemini 3.6 FlashGoogle13/16 mesurés · 13 comparables
Rang 35Muse Spark 1.1Meta13/16 mesurés · 12 comparables
Rang 36Grok 4.5xAI14/16 mesurés · 14 comparables
Rang 37Qwen 3.7 MaxAlibaba11/16 mesurés · 11 comparables
Rang 38GPT 5.2OpenAI11/16 mesurés · 10 comparables
Rang 39Gemini 3 ProGoogle10/16 mesurés · 9 comparables
Rang 40Claude Sonnet 4.6Anthropic15/16 mesurés · 13 comparables
Rang 41Muse SparkMeta9/16 mesurés · 9 comparables
Rang 42Grok 4.20xAI8/16 mesurés · 8 comparables
Rang 43GLM 5.3 FlashZ.ai14/16 mesurés · 13 comparables
Rang 44Gemini 3 FlashGoogle11/16 mesurés · 9 comparables
Rang 45GLM 5.2Z.ai744B · 40B actifs16/16 mesurés · 15 comparables
Rang 46Kimi K2.6Moonshot AI1T · 32B actifs14/16 mesurés · 12 comparables
Rang 47GPT 5 ProOpenAI3/16 mesurés · 3 comparables
Rang 48Inkling SmallThinking Machines Lab276B · 12B actifs13/16 mesurés · 12 comparables
Rang 49Claude Opus 4.5Anthropic11/16 mesurés · 10 comparables
Rang 50Kimi K2.7 CodeMoonshot AI1T · 32B actifs11/16 mesurés · 10 comparables
Rang 51GPT 5OpenAI11/16 mesurés · 10 comparables
Rang 52GLM 5.1Z.ai744B · 40B actifs14/16 mesurés · 12 comparables
Rang 53GPT 5.1OpenAI10/16 mesurés · 10 comparables
Rang 54Qwen 3.8 27BAlibaba27B12/16 mesurés · 11 comparables
Rang 55Qwen 3.6 Max PreviewAlibaba4/16 mesurés · 3 comparables
Rang 56Grok 4.3xAI13/16 mesurés · 12 comparables
Rang 57DeepSeek V4 Pro (2026-04-22)DeepSeek1,6T · 49B actifs14/16 mesurés · 13 comparables
Rang 58GPT 5.4 MiniOpenAI12/16 mesurés · 12 comparables
Rang 59InklingThinking Machines Lab975B · 41B actifs15/16 mesurés · 14 comparables
Rang 60Kimi K2.5Moonshot AI1T · 32B actifs12/16 mesurés · 11 comparables
Rang 61Qwen 3.6 PlusAlibaba11/16 mesurés · 11 comparables
Rang 62Qwen 3.7 PlusAlibaba9/16 mesurés · 7 comparables
Rang 63MiniMax M3MiniMax14/16 mesurés · 13 comparables
Rang 64Claude Sonnet 4.5Anthropic12/16 mesurés · 11 comparables
Rang 65Qwen 3.5 397B-A17BAlibaba397B · 17B actifs12/16 mesurés · 6 comparables
Rang 66Qwen 3.6 27BAlibaba27B13/16 mesurés · 8 comparables
Rang 67DeepSeek V4 Flash (2026-04-22)DeepSeek284B · 13B actifs9/16 mesurés · 5 comparables
Rang 68GLM 5Z.ai9/16 mesurés · 7 comparables
Rang 69GPT 5.4 NanoOpenAI12/16 mesurés · 12 comparables
Rang 70Gemini 2.5 ProGoogle9/16 mesurés · 7 comparables
Rang 71Gemini 3.5 Flash LiteGoogle12/16 mesurés · 12 comparables
Rang 72Gemini 3.1 Flash LiteGoogle13/16 mesurés · 13 comparables
Rang 73Claude Opus 4.1Anthropic7/16 mesurés · 6 comparables
Rang 74Qwen 3.6 35B-A3BAlibaba35B · 3B actifs11/16 mesurés · 6 comparables
Rang 75Gemma 4 31B ITGoogle30,7B6/16 mesurés · 2 comparables
Rang 76Qwen 3.5 35B-A3BAlibaba35B · 3B actifs11/16 mesurés · 6 comparables
Rang 77GPT 5.5 InstantOpenAI5/16 mesurés · 4 comparables
Rang 78mistral Medium 3.5Mistral AI9/16 mesurés · 8 comparables
Rang 79Qwen 3.5 9BAlibaba9B8/16 mesurés · 4 comparables
Rang 80Qwen 3 32BAlibaba32,8B5/16 mesurés · 4 comparables
Rang 81Qwen 3 14BAlibaba14,8B4/16 mesurés · 3 comparables
Rang 82GPT 4.5OpenAI2/16 mesurés · 2 comparables
18 modèles sans score ECI directement comparable
Aucun rangGemini 4 argonGoogle4/16 mesurés · 3 comparables
Aucun rangGPT 6 SolOpenAI9/16 mesurés · 8 comparables
Aucun rangGrok 4.7xAI6/16 mesurés · 6 comparables
Aucun rangGPT 6 LunaOpenAI9/16 mesurés · 8 comparables
Aucun rangMiMo V2.6 ProXiaomi5/16 mesurés · 4 comparables
Aucun rangGLM 5.3 MaxZ.ai1/16 mesurés · 1 comparables
Aucun rangGPT 5.2 Chat Latest (2026-02-10)OpenAI1/16 mesurés · 1 comparables
Aucun rangMiMo V2.5 ProXiaomi11/16 mesurés · 10 comparables
Aucun rangHY3Tencent7/16 mesurés · 3 comparables
Aucun rangGrok 4.1xAI2/16 mesurés · 2 comparables
Aucun rangQwen 3.5 27BAlibaba27B6/16 mesurés · 1 comparables
Aucun rangQwen 3.8 Flash NextAlibaba125B · 6B actifs7/16 mesurés · 3 comparables
Aucun rangGemma 4 12B ITGoogle12B4/16 mesurés · 0 comparables
Aucun rangGemma 4 26B-A4B ITGoogle25,2B · 3,8B actifs4/16 mesurés · 0 comparables
Aucun rangQwen 3.8 2.4T-A95BAlibaba2,4T · 95B actifs6/16 mesurés · 3 comparables
Aucun rangMiMo V2.6 FlashXiaomi5/16 mesurés · 4 comparables
Aucun rangGPT 6.1 SolOpenAI7/16 mesurés · 6 comparables
Aucun rangGemma 4 31BGoogle7/16 mesurés · 3 comparables