LLM Benchmarks

Mesures étayées par des sources

Guides et méthodologie

Comprendre les benchmarks, comparer équitablement les mesures et retrouver les sources de LLM Benchmarks. Méthodologie, guide des tests et analyses des données.

D’où viennent les scores ?

Un score devient utile lorsque l’on sait quel modèle a été testé et dans quelles conditions. Nous expliquons ici comment nous sélectionnons, vérifions et présentons les résultats publiés dans le tableau comparatif.

Notre contribution consiste à rassembler et vérifier les éléments probants. Les évaluations elles-mêmes sont réalisées par les organismes de benchmark et les fournisseurs de modèles cités.

1. Quels modèles et quelles sources sont retenus ?

La sélection associe les modèles de l’Epoch Capabilities Index à d’autres évaluations exigeantes, à des sorties récentes vérifiées chez les fournisseurs et à une place réservée aux modèles ouverts. Elle inclut ainsi de petits modèles peu représentés dans les grands classements. Il s’agit d’un échantillon du marché, pas d’un répertoire exhaustif.

Nous utilisons les résultats des organismes de benchmark, des évaluations indépendantes et des rapports documentés de fournisseurs. L’identité du modèle, la source, la version du test et les conditions de publication doivent être traçables. Un score accessible publiquement n’est pas automatiquement autorisé à la republication. Les rapports des fournisseurs restent attribués à leurs auteurs.

2. Quand deux scores sont-ils comparables ?

Le nom du benchmark ne suffit pas. Nous tenons compte de l’édition, de la version, de la fenêtre de tâches, de la métrique, de l’unité, des outils, de la configuration de l’agent et de la procédure d’évaluation. Chaque benchmark possède un protocole de comparaison défini. D’autres configurations peuvent apporter des informations utiles, sans recevoir implicitement le même statut de classement.

  • Rang : position dans le protocole admissible du benchmark, pas un jugement global sur le modèle.
  • ≈ : résultat complémentaire obtenu dans d’autres conditions. Consulter d’abord les détails de la mesure.
  • Conflit : des sources crédibles divergent pour une même configuration documentée. Aucun rang unique fiable.
  • Cellule vide : aucune mesure correspondante n’est visible. Cela ne signifie ni zéro point ni un test échoué.

3. Quel niveau de raisonnement est sélectionné ?

Au sein d’une même source et d’une même série de tests, nous privilégions le niveau fixe documenté le plus élevé : max, xhigh, high, medium, low, minimal, off. Nous ne choisissons pas a posteriori le meilleur score. Une mesure Max valide peut donc être inférieure à High. Nous ne mélangeons pas agents, versions de test ou fenêtres de tâches pour obtenir un niveau supérieur.

Adaptive indique que le raisonnement est activé, mais ne prouve pas un budget maximal fixe. Les réglages non divulgués restent inconnus. Le niveau High de deux fournisseurs ne représente pas nécessairement le même budget de calcul.

4. Que signifient les dates et les catégories de sources ?

La date du test, sa publication, la version du jeu de données et la première observation sont des événements différents. Lorsqu’une source ne date pas une exécution, nous pouvons utiliser la première observation de ce score exact. Cela ne prouve pas que le test soit récent. Les détails de la mesure précisent la date retenue et son fondement.

L’autorité de la source et la qualité des éléments probants sont évaluées séparément. A+, A, B et C sont nos catégories de sources et de preuves, pas des probabilités statistiques d’exactitude. Une source bien classée n’efface pas les différences entre conditions de test.

5. Ce que le tableau ne permet pas d’établir

De petits écarts ne constituent pas un avantage démontré sans analyse appropriée de l’incertitude. Les points de pourcentage ne sont pas une amélioration relative en pourcentage. Un indice composite mesure autre chose qu’un taux de réussite à une tâche précise ; nous ne faisons pas la moyenne des colonnes pour créer notre propre score global.

Les résultats de quantification et de matériel restent des études complémentaires. Des moteurs d’exécution, GPU ou sous-ensembles de tâches différents empêchent d’isoler l’effet de la quantification. Taille des fichiers de poids, capacité du GPU et mémoire réellement utilisée sont des grandeurs différentes. Les tests matériels publiés ne sont pas des mesures de laboratoire réalisées par LLM Benchmarks.

6. Vérifier les preuves et signaler une erreur

Ouvrir une valeur du tableau permet de consulter sa source, sa configuration, sa date et les variantes de raisonnement disponibles. Les données sont téléchargeables en CSV et JSON. Pour signaler une erreur, préciser le modèle, le benchmark, la valeur concernée et un lien vers la source originale. Les sources modifiées sont de nouveau contrôlées selon les règles de publication ; les erreurs confirmées sont corrigées dans les données.

Que mesure chaque benchmark ?

La métrique utile dépend de votre tâche. Un indice général, un test de connaissances et l’évaluation d’un agent de programmation mesurent des choses différentes. Ce guide aide à interpréter chaque type de résultat.

Partir de la tâche, vérifier le protocole d’évaluation, puis comparer les scores.

Capacités générales : ECI et indices composites

L’Epoch Capabilities Index combine les résultats de différents tests sur une échelle commune de capacités. Il fournit une première vue d’ensemble de plusieurs domaines. Sa valeur n’est pas un pourcentage de tâches résolues. De nouvelles données peuvent modifier les estimations, même pour des modèles inchangés.

Notre interprétation : utiliser un indice pour présélectionner les modèles, puis examiner les tests pertinents pour votre travail. Un assistant spécialisé peut convenir malgré un indice général inférieur. Il ne faut pas soustraire les scores d’indices différents.

Connaissances et raisonnement : GPQA, HLE et mathématiques

GPQA contient des questions difficiles rédigées par des spécialistes en biologie, physique et chimie. Le tableau suit le sous-ensemble Diamond. Ces tests renseignent sur la résolution de problèmes dans les conditions indiquées. Ils ne mesurent pas automatiquement la fiabilité d’une recherche ouverte.

Le jeu HLE complet et son sous-ensemble textuel restent séparés. L’accès aux outils peut transformer la tâche. En mathématiques, la difficulté compte : un bon score sur un ensemble ancien ou plus facile ne démontre pas une réussite sur de nouvelles tâches difficiles. Pour une application de connaissances, nous testerions aussi vos propres questions avec des sources vérifiables.

Programmation : une tâche isolée ou un agent complet ?

Un test de programmation peut porter sur un problème autonome ou sur un agent intervenant dans un dépôt existant. SWE-bench évalue de vrais problèmes logiciels. Les outils, l’orchestration de l’agent et l’environnement de test influencent aussi le résultat.

Notre interprétation : pour choisir un agent de programmation, comparer des configurations de systèmes documentées. Un test plus ciblé peut être plus pertinent pour des fonctions isolées. Verified, Pro et les fenêtres variables de Rebench ne sont pas interchangeables. La réussite sur un ensemble ne prédit pas celle dans votre dépôt.

Agents et outils : le déroulement fait partie du test

Les évaluations de terminal, d’utilisation d’outils et d’agents à plusieurs tours exigent qu’un modèle agisse dans un environnement défini. API disponibles, configuration de l’agent, limites de temps et d’appels font partie de la signification du score. Les deux configurations Banking restent ainsi séparées dans notre tableau.

Notre interprétation : ces résultats sont surtout utiles lorsque le test ressemble à votre processus. Sinon, des aspects essentiels comme les autorisations, la récupération après erreur et vos critères de réussite restent non évalués. Consulter les détails et tester quelques situations représentatives de vos usages.

Interpréter les tests de consignes et de préférences

IFEval teste des consignes objectivement vérifiables, notamment des contraintes de sortie. C’est utile lorsque votre processus dépend du respect d’exigences précises. Cela ne démontre ni une exactitude factuelle générale ni la qualité spécialisée de chaque réponse.

Les classements Arena reflètent des préférences selon leur procédure de comparaison. Une réponse préférée n’est pas nécessairement exacte. Notre interprétation : les préférences peuvent éclairer le choix d’un style de rédaction ; l’exactitude vérifiable nécessite aussi des contrôles propres au domaine.

Tous les benchmarks du tableau comparatif

Le répertoire suivant renvoie aux pages originales et indique nos protocoles de comparaison. Les versions et les tâches comptent davantage que des noms de benchmarks similaires. Le regroupement sert à s’orienter ; il ne pondère pas un classement global.

Vue d’ensemble

Epoch Capabilities Index

Indice composite de capacités ajusté par Epoch AI à partir de plus de 50 benchmarks.

Source de comparaison
Epoch Capabilities Index
Version / tâches
Epoch ECI snapshot 2026-10-01 · official-composite-fit
Métrique / unité
eci · index_points
Page originale du benchmark ↗
Artificial Analysis Intelligence Index

Artificial Analysis' composite Intelligence Index; one value per model and reasoning setting. The protocol identifies the methodology version.

Source de comparaison
Artificial Analysis · Intelligence Index evaluations
Version / tâches
Artificial Analysis Intelligence Index v4.3 · intelligence-index-v4-3
Métrique / unité
index_score · points
Page originale du benchmark ↗
Arena Text

Classement des modèles de texte selon les préférences humaines.

Source de comparaison
Arena Text
Version / tâches
2026-09-30 · overall-style-control
Métrique / unité
arena_score · points
Page originale du benchmark ↗
LiveBench

Évaluation objective fréquemment actualisée couvrant de nombreuses capacités.

Source de comparaison
LiveBench
Version / tâches
2026-06-25 · overall-seven-category
Métrique / unité
category_balanced_average · percent
Page originale du benchmark ↗

Connaissances et raisonnement

Humanity's Last Exam · Full multimodal

Les valeurs comparables utilisent le protocole multimodal complet de 2 500 questions sans outils ; les autres protocoles restent séparés.

Source de comparaison
Scale AI Labs · Humanity's Last Exam Full
Version / tâches
HLE finalized 2,500 · Scale protocol 2025-04-03 · full-multimodal-2500-no-tools
Métrique / unité
accuracy · percent
Page originale du benchmark ↗
Humanity's Last Exam · Text-only

Sous-ensemble textuel d'Artificial Analysis : 2 158 des 2 500 questions, sans outils. Un autre ensemble de questions, non une mesure affaiblie du protocole complet.

Source de comparaison
Artificial Analysis · Intelligence Index evaluations
Version / tâches
HLE text-only (Artificial Analysis) · text-only-2158-no-tools
Métrique / unité
accuracy · percent
Page originale du benchmark ↗
SimpleQA Verified

Connaissances factuelles en réponse courte et qualité de l’abstention.

Source de comparaison
Epoch AI SimpleQA Verified
Version / tâches
Epoch independent Inspect runs · verified-1000-epoch-inspect
Métrique / unité
accuracy · percent
Page originale du benchmark ↗
GPQA Diamond

Questions scientifiques de niveau supérieur en physique, chimie et biologie.

Source de comparaison
Vals AI GPQA Diamond
Version / tâches
GPQA Diamond v1 · Vals dual-prompt · diamond-198-zero-and-five-shot-cot
Métrique / unité
accuracy · percent
Page originale du benchmark ↗
MMLU-Pro

Broad academic multiple-choice knowledge and reasoning across fourteen subjects; Vals AI's independent run over the MMLU-Pro set.

Source de comparaison
Vals AI · MMLU-Pro
Version / tâches
Vals MMLU-Pro v1 · vals-mmlu-pro-overall
Métrique / unité
accuracy · percent
Page originale du benchmark ↗
FrontierMath T1–3

Évaluations indépendantes d’Epoch AI sur 295 problèmes de mathématiques avancées ; le niveau 4 reste séparé.

Source de comparaison
Epoch AI · FrontierMath Tiers 1–3 v2
Version / tâches
2.0.0 · private-285-of-295-problem-tiers-1-3-set
Métrique / unité
mean_score · percent
Page originale du benchmark ↗
ARC-AGI-2

Induction de règles abstraites sur 360 tâches, avec variantes pass@2 séparées par effort.

Source de comparaison
ARC-AGI-2
Version / tâches
v2 · semi-private-120
Métrique / unité
accuracy · percent
Page originale du benchmark ↗
FrontierMath T4

Independent Epoch AI runs on the 41 private research-level problems from the 43-problem FrontierMath Tier 4 v2 set; the two public examples and Tiers 1–3 are not mixed into this column.

Source de comparaison
Epoch AI · FrontierMath Tier 4 v2
Version / tâches
2.0.0 · private-41-of-43-problem-tier-4-set
Métrique / unité
mean_score · percent
Page originale du benchmark ↗
MMMU-Pro

Connaissances expertes et raisonnement multimodaux.

Source de comparaison
Vals AI · MMMU-Pro
Version / tâches
Vals MMMU-Pro v1 · vals-mmmu-pro-overall
Métrique / unité
accuracy · percent
Page originale du benchmark ↗
CritPt

Research-level physics reasoning across 71 open-ended challenges graded automatically.

Source de comparaison
Artificial Analysis · Intelligence Index evaluations
Version / tâches
CritPt (Artificial Analysis) · 70-challenges-official-grading
Métrique / unité
accuracy · percent
Page originale du benchmark ↗
SimpleBench

Trick-question common-sense reasoning where humans still beat frontier models; average of five runs.

Source de comparaison
Epoch AI mirror · SimpleBench
Version / tâches
SimpleBench current leaderboard · official-set-avg-at-5
Métrique / unité
accuracy_avg_at_5 · percent
Page originale du benchmark ↗
Chess Puzzles

Epoch AI's 100 engine-generated chess puzzles with one best move each, run and dated by Epoch.

Source de comparaison
Epoch AI · Chess Puzzles
Version / tâches
Epoch AI Chess Puzzles v1 · 100-engine-generated-single-best-move-puzzles
Métrique / unité
mean_score · percent
Page originale du benchmark ↗
ARC-AGI-1

Original ARC-AGI abstraction puzzles on the semi-private set as reported by ARC Prize.

Source de comparaison
Epoch AI mirror · ARC-AGI-1
Version / tâches
ARC-AGI-1 current leaderboard · semi-private-evaluation-pass-at-2
Métrique / unité
pass_at_2_accuracy · percent
Page originale du benchmark ↗
IFEval

Instruction following. Provider reports and subset studies retain their scoring and sample-set labels; they do not form a uniform cross-model ranking.

Résultats complémentaires ; aucun protocole canonique commun n’est défini.

Page originale du benchmark ↗
IFBench

Respect précis des consignes : 300 prompts avec 344 contraintes vérifiables, exactitude stricte par consigne mesurée par le Swallow LLM Leaderboard.

Source de comparaison
Swallow LLM Leaderboard
Version / tâches
swallow-evaluation-instruct · ifbench-test-300-prompts-344-instructions
Métrique / unité
inst_level_strict_acc · percent
Page originale du benchmark ↗

Code

SWE-bench Verified

Taux de résolution de 500 problèmes logiciels réels vérifiés ; la comparaison principale utilise un agent minimal uniforme.

Source de comparaison
Vals AI SWE-bench Verified
Version / tâches
SWE-bench Verified v1 · verified-500-vals-mini-swe-agent
Métrique / unité
resolved_rate · percent
Page originale du benchmark ↗
SWE-rebench v2

Résolution récente de problèmes logiciels dans une fenêtre temporelle définie.

Source de comparaison
SWE-rebench
Version / tâches
rolling-v2 · 2026-05-15/2026-07-01
Métrique / unité
resolved_rate · percent
Page originale du benchmark ↗
SWE-bench-Live · Lite

Résolution logicielle actualisée en continu, en conservant ensemble agent, modèle et effort déclaré.

Source de comparaison
SWE-bench-Live · Lite
Version / tâches
SWE-bench-Live Lite · lite-300-python
Métrique / unité
resolved_rate · percent
Page originale du benchmark ↗
DeepSWE

Tâches originales de génie logiciel à long horizon, avec résultats séparés par agent et effort de raisonnement.

Source de comparaison
DeepSWE official live leaderboard
Version / tâches
DeepSWE v1.1 live leaderboard · 113-original-long-horizon-tasks
Métrique / unité
pass_at_1 · percent
Page originale du benchmark ↗
SWE-bench Pro Public · Scale

Scale AI Labs' separate 731-task professional software-engineering benchmark. Results keep the submitted model, agent label, confidence interval and row-specific publication date; they are never mixed with SWE-bench Verified, SWE-rebench or vendor supplemental protocols. A July 2026 OpenAI audit reported substantial task-quality concerns, so SWE-Pro should be read as one imperfect signal rather than an absolute model ranking.

Source de comparaison
Scale AI Labs · SWE-bench Pro Public
Version / tâches
Scale public 731-task leaderboard · public-731
Métrique / unité
resolved_rate · percent
Page originale du benchmark ↗
CursorBench

Évaluation d’agents de code avec niveaux de raisonnement explicites et métadonnées de coût, jetons et étapes.

Source de comparaison
Epoch AI mirror · CursorBench
Version / tâches
CursorBench current leaderboard · official-current-suite
Métrique / unité
score · percent
Page originale du benchmark ↗
FrontierCode 1.1 · Main

Tâches de code difficiles axées sur la fusion, avec agent et effort conservés pour chaque score.

Source de comparaison
Epoch AI mirror · FrontierCode 1.1
Version / tâches
FrontierCode 1.1 · main-100-hardest-tasks
Métrique / unité
mergeability_rubric_mean_at_5 · percent
Page originale du benchmark ↗
IOI

IOI 2024 and 2025 olympiad problems evaluated by Vals AI with olympiad graders.

Source de comparaison
Vals AI · IOI
Version / tâches
Vals IOI v2 · vals-ioi-2024-2026-overall
Métrique / unité
score · percent
Page originale du benchmark ↗
LiveCodeBench

Competitive programming problems released after training cutoffs; Vals AI's independent implementation, overall pass@1.

Source de comparaison
Vals AI · LiveCodeBench
Version / tâches
Vals LiveCodeBench v1 · vals-livecodebench-overall
Métrique / unité
pass_at_1 · percent
Page originale du benchmark ↗
SciCode

Programmation scientifique mesurée par la précision des sous-problèmes avec tests Python exécutables.

Source de comparaison
Epoch AI mirror · SciCode
Version / tâches
SciCode current leaderboard · scientific-research-coding-subproblems
Métrique / unité
subproblem_accuracy · percent
Page originale du benchmark ↗
ALE-Bench

Score-based algorithmic optimisation contests (AtCoder Heuristic); performance rating.

Source de comparaison
Epoch AI mirror · ALE-Bench
Version / tâches
ALE-Bench current leaderboard · atcoder-heuristic-contest-set
Métrique / unité
performance_rating · points
Page originale du benchmark ↗
Vibe Code Bench

Building complete web applications from scratch in an agent harness, evaluated by Vals AI.

Source de comparaison
Vals AI · Vibe Code Bench
Version / tâches
Vals Vibe Code Bench v1.1 · vals-vibe-code-bench-overall
Métrique / unité
score · percent
Page originale du benchmark ↗
Text Arena · Coding

Préférences humaines pour des applications web générées avec React et TypeScript.

Source de comparaison
Epoch AI mirror · Text Arena (Coding)
Version / tâches
Text Arena Coding current pool · text-arena-coding-bradley-terry
Métrique / unité
bradley_terry_rating · points
Page originale du benchmark ↗
WeirdML

Unusual machine-learning tasks solved end-to-end by writing and running code.

Source de comparaison
Epoch AI mirror · WeirdML
Version / tâches
WeirdML v2 current leaderboard · weirdml-v2-task-set
Métrique / unité
accuracy · percent
Page originale du benchmark ↗

Agents et outils

Terminal-Bench 2.0

Terminal-Bench 2.0 leaderboard over 89 hard terminal tasks; agent harness and run date stay attached to every score.

Source de comparaison
Epoch AI mirror · Terminal-Bench 2.0
Version / tâches
Terminal-Bench 2.0 · official-89-task-set
Métrique / unité
accuracy_mean · percent
Page originale du benchmark ↗
Terminal-Bench 2.1

Vals AI's independent Terminal-Bench 2.1 run with one uniform harness; vendor reports remain supplemental.

Source de comparaison
Vals AI · Terminal-Bench 2.1
Version / tâches
Vals Terminal-Bench 2.1 v2.1 · vals-terminal-bench-2-1-overall
Métrique / unité
accuracy · percent
Page originale du benchmark ↗
Terminal-Bench 3.0

Classement officiel agent-modèle sur 74 tâches terminal difficiles ; agent, effort et nombre d’essais restent liés à chaque score.

Source de comparaison
Terminal-Bench 3.0
Version / tâches
3.0 · b936386b-4afd-4ad7-aa7f-6b52bcab9853 · official-74-task-leaderboard
Métrique / unité
accuracy · percent
Page originale du benchmark ↗
τ³-Banking · Official harness

Tâches bancaires conversationnelles exigeantes avec recherche, outils et utilisateur simulé, telles que publiées sur le classement officiel.

Source de comparaison
τ³-Banking
Version / tâches
1.0.1 · banking_knowledge
Métrique / unité
pass_1 · percent
Page originale du benchmark ↗
τ³-Banking · Artificial Analysis harness

Exécution propre à Artificial Analysis sur le même domaine : 97 tâches, recherche BM25/grep et un autre utilisateur simulé. Le simulateur fait partie de la mesure, d'où une colonne distincte et non un second avis.

Source de comparaison
Artificial Analysis · Intelligence Index evaluations
Version / tâches
τ³-Banking (Artificial Analysis) · banking-97-tasks-gpt-5-4-mini-simulator
Métrique / unité
pass_at_1 · percent
Page originale du benchmark ↗
MCP-Atlas · Scale

Real-world multi-step tool use across 1,000 tasks, 36 MCP servers and 220 tools. The comparable lane uses Scale's April 2026 rescored protocol, all public and private tasks, a 100-tool-call budget and the exact row-specific publication date.

Source de comparaison
Scale AI Labs · MCP-Atlas
Version / tâches
MCP-Atlas April 2026 rescored protocol · all-1000-public-500-private-500
Métrique / unité
pass_rate · percent
Page originale du benchmark ↗
SkillsBench v1.1

Benchmark d’agents audité sur 87 tâches professionnelles ; les protocoles avec et sans compétences restent séparés.

Source de comparaison
SkillsBench v1.1
Version / tâches
v1.1 · official-87-tasks-with-skills
Métrique / unité
pass_rate · percent
Page originale du benchmark ↗
APEX-Agents

Travail professionnel à long horizon en banque, conseil et droit avec outils bureautiques et exécution de code.

Source de comparaison
Epoch AI mirror · APEX-Agents
Version / tâches
APEX-Agents current leaderboard · 480-professional-tasks-33-worlds
Métrique / unité
pass_at_1 · percent
Page originale du benchmark ↗
Berkeley Function Calling Leaderboard V4

Appels de fonctions, utilisation d’outils en plusieurs tours et résistance aux hallucinations dans BFCL V4.

Source de comparaison
BFCL V4
Version / tâches
v4-ede5081a24bc · overall
Métrique / unité
overall_accuracy · percent
Page originale du benchmark ↗
LMArena Agent Arena

Human preference evaluation of agent outcomes. Every score retains the submitted model, disclosed thinking label, confidence interval and observation count.

Source de comparaison
LMArena Agent Arena
Version / tâches
2026-09-30 · overall-ips-aggregate
Métrique / unité
ips_score · ips
Page originale du benchmark ↗
AppWorld

Interactive coding-agent benchmark across controllable applications and APIs; model, method, scaffold and task/scenario metrics remain attached to each run.

Source de comparaison
AppWorld official leaderboard
Version / tâches
official-c1f56015cf7c · test-challenge-all
Métrique / unité
task_goal_completion · percent
Page originale du benchmark ↗
Vending-Bench 2

Long-horizon business simulation: mean final balance in USD after a simulated year.

Source de comparaison
Epoch AI mirror · Vending-Bench 2
Version / tâches
Vending-Bench 2 current leaderboard · one-simulated-year-mean-final-balance
Métrique / unité
mean_final_balance_usd · USD
Page originale du benchmark ↗
GDPval-AA v2.1

Successor of GDPval-AA v2: the same 220 tasks and judges, Elo refitted and pinned to DeepSeek V4.1 Flash (max) at 1600 - not comparable with v2 values.

Source de comparaison
Artificial Analysis · Intelligence Index evaluations
Version / tâches
GDPval-AA v2.1 (Crowd-BT Elo, DeepSeek V4.1 Flash (max) at 1600) · 220-tasks-elo-v2-1
Métrique / unité
elo · points
Page originale du benchmark ↗

Que peut-on déduire des données ?

Nous ne regardons pas seulement quel modèle obtient le plus de points. Ces analyses montrent où les preuves permettent une comparaison, où des mesures manquent et quelles conclusions iraient trop loin.

Les indicateurs sont calculés à partir du même état des données que le tableau. L’interprétation est celle de LLM Benchmarks ; les mesures proviennent des sources citées.

Comment utiliser ces analyses

Le choix des modèles et la disponibilité des tests publiés façonnent chaque analyse. Plus de preuves signifie davantage d’informations vérifiables, pas automatiquement un meilleur modèle. Chaque analyse précise donc son unité de comptage, son état des données et ses limites. Elle est recalculée avec le jeu de données publié et ne constitue pas une reproduction indépendante des tests.

Lire les comparaisons et études de cas →

01

Petits modèles ouverts : quelles preuves pour les comparer ?

Choisir un petit modèle ouvert demande plus qu’un bon score isolé. Pour les modèles retenus de moins de 36 milliards de paramètres au total, nous examinons combien de couples modèle-benchmark sont documentés et disposent de preuves directement comparables.

Une couverture large facilite la présélection. Elle mesure les preuves disponibles, pas la qualité du modèle ni ses besoins en mémoire.

Quelle quantité de preuves est disponible ?

Un couple associe un modèle à un benchmark du tableau complet. Plusieurs niveaux de raisonnement ne comptent qu’une fois ; les études de quantification ne sont pas des preuves pour le modèle de base. « Comparable » exige au moins un résultat sans conflit ayant ce statut dans le tableau. Toutes les configurations de base recensées sont prises en compte, pas seulement la vue filtrée actuelle.

11modèles retenus
171 / 506couples modèle-benchmark documentés
100avec des preuves comparables
Couverture des mesures par domaine

Chaque barre couvre tous les couples possibles du domaine. Nombres : comparables / documentés / possibles.

Vue d’ensemble19 / 19 / 44
Connaissances et raisonnement34 / 71 / 165
Code27 / 46 / 154
Agents et outils20 / 35 / 143
Preuve comparableAutres preuves uniquementAucune preuve recensée

Notre comptage à partir des données publiques. Données au : . JSON · CSV

Qu’en déduire pour le choix du modèle ?

Chercher d’abord des preuves dans votre domaine. De nombreuses mesures de connaissances ne comblent pas une lacune sur les agents de programmation. Comparer ensuite les benchmarks communs aux candidats et vérifier leurs protocoles. Les nombres totaux de paramètres inconnus ne sont pas déduits des noms et n’ouvrent pas droit à l’inclusion dans cette analyse sous 36B.

Les parties claires du graphique représentent des lacunes de notre jeu de données. Un modèle peut avoir été testé ailleurs sans que nous disposions d’un résultat publiable. La sélection des modèles est également organisée. Les barres ne prouvent donc aucun avantage général des modèles ouverts ou fermés.

Reproduire l’analyse

Dans l’export JSON, sélectionner les modèles ouverts dont le nombre total documenté de paramètres est supérieur à zéro et inférieur à 36 milliards. Ne retenir que les benchmarks du site. Dédupliquer les preuves de base par modèle et benchmark, en séparant les variantes quantifiées. Les données incluent des résultats plus anciens toujours admissibles à la publication. Vérifier aussi les dates des mesures avant un choix d’utilisation.

02

Même benchmark, conditions différentes

Deux scores publiés peuvent être exacts sans permettre de calculer un écart équitable. Nous comptons les couples modèle-benchmark disposant de preuves comparables et expliquons cette distinction avec nos protocoles d’évaluation.

Mesuré en commun ne signifie pas automatiquement directement comparable. Version, tâches et configuration doivent correspondre avant de calculer un écart.

Documenté ne signifie pas toujours comparable

L’analyse compte les couples parmi tous les modèles retenus et les benchmarks du site. Un couple est documenté dès qu’un résultat de base existe. Pour être comparable, il doit aussi disposer d’au moins un résultat sans conflit ayant le statut correspondant dans le tableau. Les autres couples ne possèdent que des preuves complémentaires ou non directement comparables. Les variantes de raisonnement ne sont pas comptées plusieurs fois.

100modèles retenus
2 221 / 4 600couples modèle-benchmark documentés
1 991avec des preuves comparables
Couverture des mesures par domaine

Chaque barre couvre tous les couples possibles du domaine. Nombres : comparables / documentés / possibles.

Vue d’ensemble275 / 275 / 400
Connaissances et raisonnement705 / 816 / 1 500
Code589 / 683 / 1 400
Agents et outils422 / 447 / 1 300
Preuve comparableAutres preuves uniquementAucune preuve recensée

Notre comptage à partir des données publiques. Données au : . JSON · CSV

Trois situations où un écart induit en erreur

SWE-bench : un modèle dans l’agent d’un fournisseur et un autre dans un environnement uniforme représentent d’abord deux systèmes. Notre comparaison stricte Verified utilise le protocole Vals défini. Pour Pro, les résultats de systèmes déclarés restent séparés du protocole directement comparable.

HLE : le jeu complet et le sous-ensemble textuel ont des dénominateurs différents. Les outils modifient aussi les méthodes de résolution autorisées. Un écart en points de pourcentage entre ces configurations n’isolerait pas le progrès du modèle.

SWE-rebench : des fenêtres de tâches différentes changent les problèmes à résoudre. Une ancienne fenêtre documentée peut former sa propre cohorte de comparaison. Son rang appartient à cette fenêtre et ne doit pas être assimilé à celui de la fenêtre actuelle.

Une comparaison défendable en trois étapes

Sélectionner deux à quatre modèles et un domaine pertinent. Limiter l’affichage aux benchmarks mesurés pour tous les modèles retenus. Examiner ensuite les indications de comparabilité et les détails avant d’interpréter les écarts au modèle de référence. Même un écart techniquement valide n’est pas un test de significativité statistique.

Notre conclusion : un résultat supplémentaire de fournisseur enrichit l’information sans créer automatiquement un nouveau rang équitable. Rendre cette distinction visible est plus utile que forcer tous les scores dans un classement unique.

03

Plus de raisonnement ne garantit pas un meilleur score

Davantage de calcul est souvent assimilé à un meilleur résultat. Nous recherchons dans les données publiées des exemples où un niveau fixe de raisonnement supérieur obtient un score inférieur dans la même configuration d’évaluation divulguée.

Un contre-exemple remet en cause une amélioration garantie. Il ne signifie pas que moins de raisonnement soit généralement préférable.

Exemples dans cet état des données

Nous comparons des niveaux fixes documentés pour un même modèle, une même source, version de test, série de tâches, métrique, configuration d’outils, orchestration d’agent et procédure d’évaluation. Les tailles d’échantillon déclarées doivent aussi correspondre. Nous utilisons des preuves récentes et actuelles du protocole canonique, sans conflit ni avertissement de contamination. Les scores multiples ambigus à un même niveau sont exclus.

Claude Fable 5.1 · CritPt
xhigh31.1 %
max29.7 %

CritPt current leaderboard · Epoch AI mirror · CritPt

Dates de référence des preuves: 2 septembre 2026 / 2 septembre 2026. Ne prouve pas un effet causal du raisonnement.

Claude Fable 5 · Vending 2
high5680.26 USD
max4966.64 USD

Vending-Bench 2 current leaderboard · Epoch AI mirror · Vending-Bench 2

Dates de référence des preuves: 2 septembre 2026 / 2 septembre 2026. Ne prouve pas un effet causal du raisonnement.

Claude Opus 4.7 · ARC-AGI-1
high93.5 %
max92.0 %

ARC-AGI-1 current leaderboard · Epoch AI mirror · ARC-AGI-1

Dates de référence des preuves: 2 septembre 2026 / 2 septembre 2026. Ne prouve pas un effet causal du raisonnement.

Ce que ces exemples permettent d’affirmer

Ces contre-exemples sont choisis intentionnellement ; ils ne constituent ni un échantillon représentatif ni une estimation de fréquence. Les dates de test et les réglages non divulgués peuvent encore jouer un rôle. Sans répétitions ni analyse appropriée de l’incertitude, la cause d’un écart ne peut pas être établie.

Notre tableau sélectionne donc par défaut le niveau documenté le plus élevé de la série choisie, plutôt que le meilleur score obtenu a posteriori parmi tous les niveaux. La règle est ainsi traçable. Pour votre application, tester ensemble qualité, temps de réponse et coût : les seuls scores de qualité présentés ici ne constituent pas un classement d’efficacité.

Qui gère ce site ?

LLM Benchmarks est un projet exploité à titre privé par Christopher Böhm. Il rassemble les évaluations publiées de modèles, leurs sources et leurs limites pour les comparer au même endroit.

Une sélection traçable nous importe davantage qu’un classement apparemment incontestable. Chaque comparaison doit permettre de remonter aux preuves.

Notre contribution

Nous rapprochons identités des modèles et versions des benchmarks, séparons les conditions de test différentes, signalons les données incertaines ou contradictoires et proposons des outils de comparaison et d’export. Les explications et analyses rendent ces décisions compréhensibles. Nous ne présentons pas les mesures de tiers comme nos propres tests.

Responsabilité et maintenance

Christopher Böhm est l’exploitant et l’interlocuteur du projet. La collecte des données et les contrôles techniques sont partiellement automatisés. Le projet maintient les règles de publication, l’attribution des sources et les preuves complémentaires sélectionnées. L’automatisation peut propager des erreurs : les liens vers les sources, les détails des mesures et le contact de correction font donc partie du service.

Financement et règles de sélection

L’exploitant accepte un soutien volontaire via PayPal. Le site est également préparé pour un emplacement publicitaire AdSense manuel. L’inclusion des modèles, le choix des mesures et les rangs suivent les règles décrites dans la méthodologie. Citer une source indique l’origine d’un résultat et ne constitue pas une recommandation de produit.

Contact et corrections

Vous avez repéré un score erroné, une mauvaise identification de modèle ou une limite manquante ? Envoyez le nom du modèle, le benchmark, l’information concernée et, si possible, une source originale. Les suggestions de tests publiés encore absents sont également bienvenues. Merci de ne pas transmettre de données confidentielles.