Mesures étayées par des sources
Guides et méthodologie
Comprendre les benchmarks, comparer équitablement les mesures et retrouver les sources de LLM Benchmarks. Méthodologie, guide des tests et analyses des données.
D’où viennent les scores ?
Un score devient utile lorsque l’on sait quel modèle a été testé et dans quelles conditions. Nous expliquons ici comment nous sélectionnons, vérifions et présentons les résultats publiés dans le tableau comparatif.
Notre contribution consiste à rassembler et vérifier les éléments probants. Les évaluations elles-mêmes sont réalisées par les organismes de benchmark et les fournisseurs de modèles cités.
1. Quels modèles et quelles sources sont retenus ?
La sélection associe les modèles de l’Epoch Capabilities Index à d’autres évaluations exigeantes, à des sorties récentes vérifiées chez les fournisseurs et à une place réservée aux modèles ouverts. Elle inclut ainsi de petits modèles peu représentés dans les grands classements. Il s’agit d’un échantillon du marché, pas d’un répertoire exhaustif.
Nous utilisons les résultats des organismes de benchmark, des évaluations indépendantes et des rapports documentés de fournisseurs. L’identité du modèle, la source, la version du test et les conditions de publication doivent être traçables. Un score accessible publiquement n’est pas automatiquement autorisé à la republication. Les rapports des fournisseurs restent attribués à leurs auteurs.
2. Quand deux scores sont-ils comparables ?
Le nom du benchmark ne suffit pas. Nous tenons compte de l’édition, de la version, de la fenêtre de tâches, de la métrique, de l’unité, des outils, de la configuration de l’agent et de la procédure d’évaluation. Chaque benchmark possède un protocole de comparaison défini. D’autres configurations peuvent apporter des informations utiles, sans recevoir implicitement le même statut de classement.
- Rang : position dans le protocole admissible du benchmark, pas un jugement global sur le modèle.
- ≈ : résultat complémentaire obtenu dans d’autres conditions. Consulter d’abord les détails de la mesure.
- Conflit : des sources crédibles divergent pour une même configuration documentée. Aucun rang unique fiable.
- Cellule vide : aucune mesure correspondante n’est visible. Cela ne signifie ni zéro point ni un test échoué.
3. Quel niveau de raisonnement est sélectionné ?
Au sein d’une même source et d’une même série de tests, nous privilégions le niveau fixe documenté le plus élevé : max, xhigh, high, medium, low, minimal, off. Nous ne choisissons pas a posteriori le meilleur score. Une mesure Max valide peut donc être inférieure à High. Nous ne mélangeons pas agents, versions de test ou fenêtres de tâches pour obtenir un niveau supérieur.
Adaptive indique que le raisonnement est activé, mais ne prouve pas un budget maximal fixe. Les réglages non divulgués restent inconnus. Le niveau High de deux fournisseurs ne représente pas nécessairement le même budget de calcul.
4. Que signifient les dates et les catégories de sources ?
La date du test, sa publication, la version du jeu de données et la première observation sont des événements différents. Lorsqu’une source ne date pas une exécution, nous pouvons utiliser la première observation de ce score exact. Cela ne prouve pas que le test soit récent. Les détails de la mesure précisent la date retenue et son fondement.
L’autorité de la source et la qualité des éléments probants sont évaluées séparément. A+, A, B et C sont nos catégories de sources et de preuves, pas des probabilités statistiques d’exactitude. Une source bien classée n’efface pas les différences entre conditions de test.
5. Ce que le tableau ne permet pas d’établir
De petits écarts ne constituent pas un avantage démontré sans analyse appropriée de l’incertitude. Les points de pourcentage ne sont pas une amélioration relative en pourcentage. Un indice composite mesure autre chose qu’un taux de réussite à une tâche précise ; nous ne faisons pas la moyenne des colonnes pour créer notre propre score global.
Les résultats de quantification et de matériel restent des études complémentaires. Des moteurs d’exécution, GPU ou sous-ensembles de tâches différents empêchent d’isoler l’effet de la quantification. Taille des fichiers de poids, capacité du GPU et mémoire réellement utilisée sont des grandeurs différentes. Les tests matériels publiés ne sont pas des mesures de laboratoire réalisées par LLM Benchmarks.
6. Vérifier les preuves et signaler une erreur
Ouvrir une valeur du tableau permet de consulter sa source, sa configuration, sa date et les variantes de raisonnement disponibles. Les données sont téléchargeables en CSV et JSON. Pour signaler une erreur, préciser le modèle, le benchmark, la valeur concernée et un lien vers la source originale. Les sources modifiées sont de nouveau contrôlées selon les règles de publication ; les erreurs confirmées sont corrigées dans les données.
Que mesure chaque benchmark ?
La métrique utile dépend de votre tâche. Un indice général, un test de connaissances et l’évaluation d’un agent de programmation mesurent des choses différentes. Ce guide aide à interpréter chaque type de résultat.
Partir de la tâche, vérifier le protocole d’évaluation, puis comparer les scores.
Capacités générales : ECI et indices composites
L’Epoch Capabilities Index combine les résultats de différents tests sur une échelle commune de capacités. Il fournit une première vue d’ensemble de plusieurs domaines. Sa valeur n’est pas un pourcentage de tâches résolues. De nouvelles données peuvent modifier les estimations, même pour des modèles inchangés.
Notre interprétation : utiliser un indice pour présélectionner les modèles, puis examiner les tests pertinents pour votre travail. Un assistant spécialisé peut convenir malgré un indice général inférieur. Il ne faut pas soustraire les scores d’indices différents.
Connaissances et raisonnement : GPQA, HLE et mathématiques
GPQA contient des questions difficiles rédigées par des spécialistes en biologie, physique et chimie. Le tableau suit le sous-ensemble Diamond. Ces tests renseignent sur la résolution de problèmes dans les conditions indiquées. Ils ne mesurent pas automatiquement la fiabilité d’une recherche ouverte.
Le jeu HLE complet et son sous-ensemble textuel restent séparés. L’accès aux outils peut transformer la tâche. En mathématiques, la difficulté compte : un bon score sur un ensemble ancien ou plus facile ne démontre pas une réussite sur de nouvelles tâches difficiles. Pour une application de connaissances, nous testerions aussi vos propres questions avec des sources vérifiables.
Programmation : une tâche isolée ou un agent complet ?
Un test de programmation peut porter sur un problème autonome ou sur un agent intervenant dans un dépôt existant. SWE-bench évalue de vrais problèmes logiciels. Les outils, l’orchestration de l’agent et l’environnement de test influencent aussi le résultat.
Notre interprétation : pour choisir un agent de programmation, comparer des configurations de systèmes documentées. Un test plus ciblé peut être plus pertinent pour des fonctions isolées. Verified, Pro et les fenêtres variables de Rebench ne sont pas interchangeables. La réussite sur un ensemble ne prédit pas celle dans votre dépôt.
Agents et outils : le déroulement fait partie du test
Les évaluations de terminal, d’utilisation d’outils et d’agents à plusieurs tours exigent qu’un modèle agisse dans un environnement défini. API disponibles, configuration de l’agent, limites de temps et d’appels font partie de la signification du score. Les deux configurations Banking restent ainsi séparées dans notre tableau.
Notre interprétation : ces résultats sont surtout utiles lorsque le test ressemble à votre processus. Sinon, des aspects essentiels comme les autorisations, la récupération après erreur et vos critères de réussite restent non évalués. Consulter les détails et tester quelques situations représentatives de vos usages.
Interpréter les tests de consignes et de préférences
IFEval teste des consignes objectivement vérifiables, notamment des contraintes de sortie. C’est utile lorsque votre processus dépend du respect d’exigences précises. Cela ne démontre ni une exactitude factuelle générale ni la qualité spécialisée de chaque réponse.
Les classements Arena reflètent des préférences selon leur procédure de comparaison. Une réponse préférée n’est pas nécessairement exacte. Notre interprétation : les préférences peuvent éclairer le choix d’un style de rédaction ; l’exactitude vérifiable nécessite aussi des contrôles propres au domaine.
Tous les benchmarks du tableau comparatif
Le répertoire suivant renvoie aux pages originales et indique nos protocoles de comparaison. Les versions et les tâches comptent davantage que des noms de benchmarks similaires. Le regroupement sert à s’orienter ; il ne pondère pas un classement global.
Vue d’ensemble
Epoch Capabilities Index
Indice composite de capacités ajusté par Epoch AI à partir de plus de 50 benchmarks.
- Source de comparaison
- Epoch Capabilities Index
- Version / tâches
- Epoch ECI snapshot 2026-10-01 · official-composite-fit
- Métrique / unité
- eci · index_points
Artificial Analysis Intelligence Index
Artificial Analysis' composite Intelligence Index; one value per model and reasoning setting. The protocol identifies the methodology version.
- Source de comparaison
- Artificial Analysis · Intelligence Index evaluations
- Version / tâches
- Artificial Analysis Intelligence Index v4.3 · intelligence-index-v4-3
- Métrique / unité
- index_score · points
Arena Text
Classement des modèles de texte selon les préférences humaines.
- Source de comparaison
- Arena Text
- Version / tâches
- 2026-09-30 · overall-style-control
- Métrique / unité
- arena_score · points
LiveBench
Évaluation objective fréquemment actualisée couvrant de nombreuses capacités.
- Source de comparaison
- LiveBench
- Version / tâches
- 2026-06-25 · overall-seven-category
- Métrique / unité
- category_balanced_average · percent
Connaissances et raisonnement
Humanity's Last Exam · Full multimodal
Les valeurs comparables utilisent le protocole multimodal complet de 2 500 questions sans outils ; les autres protocoles restent séparés.
- Source de comparaison
- Scale AI Labs · Humanity's Last Exam Full
- Version / tâches
- HLE finalized 2,500 · Scale protocol 2025-04-03 · full-multimodal-2500-no-tools
- Métrique / unité
- accuracy · percent
Humanity's Last Exam · Text-only
Sous-ensemble textuel d'Artificial Analysis : 2 158 des 2 500 questions, sans outils. Un autre ensemble de questions, non une mesure affaiblie du protocole complet.
- Source de comparaison
- Artificial Analysis · Intelligence Index evaluations
- Version / tâches
- HLE text-only (Artificial Analysis) · text-only-2158-no-tools
- Métrique / unité
- accuracy · percent
SimpleQA Verified
Connaissances factuelles en réponse courte et qualité de l’abstention.
- Source de comparaison
- Epoch AI SimpleQA Verified
- Version / tâches
- Epoch independent Inspect runs · verified-1000-epoch-inspect
- Métrique / unité
- accuracy · percent
GPQA Diamond
Questions scientifiques de niveau supérieur en physique, chimie et biologie.
- Source de comparaison
- Vals AI GPQA Diamond
- Version / tâches
- GPQA Diamond v1 · Vals dual-prompt · diamond-198-zero-and-five-shot-cot
- Métrique / unité
- accuracy · percent
MMLU-Pro
Broad academic multiple-choice knowledge and reasoning across fourteen subjects; Vals AI's independent run over the MMLU-Pro set.
- Source de comparaison
- Vals AI · MMLU-Pro
- Version / tâches
- Vals MMLU-Pro v1 · vals-mmlu-pro-overall
- Métrique / unité
- accuracy · percent
FrontierMath T1–3
Évaluations indépendantes d’Epoch AI sur 295 problèmes de mathématiques avancées ; le niveau 4 reste séparé.
- Source de comparaison
- Epoch AI · FrontierMath Tiers 1–3 v2
- Version / tâches
- 2.0.0 · private-285-of-295-problem-tiers-1-3-set
- Métrique / unité
- mean_score · percent
ARC-AGI-2
Induction de règles abstraites sur 360 tâches, avec variantes pass@2 séparées par effort.
- Source de comparaison
- ARC-AGI-2
- Version / tâches
- v2 · semi-private-120
- Métrique / unité
- accuracy · percent
FrontierMath T4
Independent Epoch AI runs on the 41 private research-level problems from the 43-problem FrontierMath Tier 4 v2 set; the two public examples and Tiers 1–3 are not mixed into this column.
- Source de comparaison
- Epoch AI · FrontierMath Tier 4 v2
- Version / tâches
- 2.0.0 · private-41-of-43-problem-tier-4-set
- Métrique / unité
- mean_score · percent
MMMU-Pro
Connaissances expertes et raisonnement multimodaux.
- Source de comparaison
- Vals AI · MMMU-Pro
- Version / tâches
- Vals MMMU-Pro v1 · vals-mmmu-pro-overall
- Métrique / unité
- accuracy · percent
CritPt
Research-level physics reasoning across 71 open-ended challenges graded automatically.
- Source de comparaison
- Artificial Analysis · Intelligence Index evaluations
- Version / tâches
- CritPt (Artificial Analysis) · 70-challenges-official-grading
- Métrique / unité
- accuracy · percent
SimpleBench
Trick-question common-sense reasoning where humans still beat frontier models; average of five runs.
- Source de comparaison
- Epoch AI mirror · SimpleBench
- Version / tâches
- SimpleBench current leaderboard · official-set-avg-at-5
- Métrique / unité
- accuracy_avg_at_5 · percent
Chess Puzzles
Epoch AI's 100 engine-generated chess puzzles with one best move each, run and dated by Epoch.
- Source de comparaison
- Epoch AI · Chess Puzzles
- Version / tâches
- Epoch AI Chess Puzzles v1 · 100-engine-generated-single-best-move-puzzles
- Métrique / unité
- mean_score · percent
ARC-AGI-1
Original ARC-AGI abstraction puzzles on the semi-private set as reported by ARC Prize.
- Source de comparaison
- Epoch AI mirror · ARC-AGI-1
- Version / tâches
- ARC-AGI-1 current leaderboard · semi-private-evaluation-pass-at-2
- Métrique / unité
- pass_at_2_accuracy · percent
IFEval
Instruction following. Provider reports and subset studies retain their scoring and sample-set labels; they do not form a uniform cross-model ranking.
Résultats complémentaires ; aucun protocole canonique commun n’est défini.
Page originale du benchmark ↗IFBench
Respect précis des consignes : 300 prompts avec 344 contraintes vérifiables, exactitude stricte par consigne mesurée par le Swallow LLM Leaderboard.
- Source de comparaison
- Swallow LLM Leaderboard
- Version / tâches
- swallow-evaluation-instruct · ifbench-test-300-prompts-344-instructions
- Métrique / unité
- inst_level_strict_acc · percent
Code
SWE-bench Verified
Taux de résolution de 500 problèmes logiciels réels vérifiés ; la comparaison principale utilise un agent minimal uniforme.
- Source de comparaison
- Vals AI SWE-bench Verified
- Version / tâches
- SWE-bench Verified v1 · verified-500-vals-mini-swe-agent
- Métrique / unité
- resolved_rate · percent
SWE-rebench v2
Résolution récente de problèmes logiciels dans une fenêtre temporelle définie.
- Source de comparaison
- SWE-rebench
- Version / tâches
- rolling-v2 · 2026-05-15/2026-07-01
- Métrique / unité
- resolved_rate · percent
SWE-bench-Live · Lite
Résolution logicielle actualisée en continu, en conservant ensemble agent, modèle et effort déclaré.
- Source de comparaison
- SWE-bench-Live · Lite
- Version / tâches
- SWE-bench-Live Lite · lite-300-python
- Métrique / unité
- resolved_rate · percent
DeepSWE
Tâches originales de génie logiciel à long horizon, avec résultats séparés par agent et effort de raisonnement.
- Source de comparaison
- DeepSWE official live leaderboard
- Version / tâches
- DeepSWE v1.1 live leaderboard · 113-original-long-horizon-tasks
- Métrique / unité
- pass_at_1 · percent
SWE-bench Pro Public · Scale
Scale AI Labs' separate 731-task professional software-engineering benchmark. Results keep the submitted model, agent label, confidence interval and row-specific publication date; they are never mixed with SWE-bench Verified, SWE-rebench or vendor supplemental protocols. A July 2026 OpenAI audit reported substantial task-quality concerns, so SWE-Pro should be read as one imperfect signal rather than an absolute model ranking.
- Source de comparaison
- Scale AI Labs · SWE-bench Pro Public
- Version / tâches
- Scale public 731-task leaderboard · public-731
- Métrique / unité
- resolved_rate · percent
CursorBench
Évaluation d’agents de code avec niveaux de raisonnement explicites et métadonnées de coût, jetons et étapes.
- Source de comparaison
- Epoch AI mirror · CursorBench
- Version / tâches
- CursorBench current leaderboard · official-current-suite
- Métrique / unité
- score · percent
FrontierCode 1.1 · Main
Tâches de code difficiles axées sur la fusion, avec agent et effort conservés pour chaque score.
- Source de comparaison
- Epoch AI mirror · FrontierCode 1.1
- Version / tâches
- FrontierCode 1.1 · main-100-hardest-tasks
- Métrique / unité
- mergeability_rubric_mean_at_5 · percent
IOI
IOI 2024 and 2025 olympiad problems evaluated by Vals AI with olympiad graders.
- Source de comparaison
- Vals AI · IOI
- Version / tâches
- Vals IOI v2 · vals-ioi-2024-2026-overall
- Métrique / unité
- score · percent
LiveCodeBench
Competitive programming problems released after training cutoffs; Vals AI's independent implementation, overall pass@1.
- Source de comparaison
- Vals AI · LiveCodeBench
- Version / tâches
- Vals LiveCodeBench v1 · vals-livecodebench-overall
- Métrique / unité
- pass_at_1 · percent
SciCode
Programmation scientifique mesurée par la précision des sous-problèmes avec tests Python exécutables.
- Source de comparaison
- Epoch AI mirror · SciCode
- Version / tâches
- SciCode current leaderboard · scientific-research-coding-subproblems
- Métrique / unité
- subproblem_accuracy · percent
ALE-Bench
Score-based algorithmic optimisation contests (AtCoder Heuristic); performance rating.
- Source de comparaison
- Epoch AI mirror · ALE-Bench
- Version / tâches
- ALE-Bench current leaderboard · atcoder-heuristic-contest-set
- Métrique / unité
- performance_rating · points
Vibe Code Bench
Building complete web applications from scratch in an agent harness, evaluated by Vals AI.
- Source de comparaison
- Vals AI · Vibe Code Bench
- Version / tâches
- Vals Vibe Code Bench v1.1 · vals-vibe-code-bench-overall
- Métrique / unité
- score · percent
Text Arena · Coding
Préférences humaines pour des applications web générées avec React et TypeScript.
- Source de comparaison
- Epoch AI mirror · Text Arena (Coding)
- Version / tâches
- Text Arena Coding current pool · text-arena-coding-bradley-terry
- Métrique / unité
- bradley_terry_rating · points
WeirdML
Unusual machine-learning tasks solved end-to-end by writing and running code.
- Source de comparaison
- Epoch AI mirror · WeirdML
- Version / tâches
- WeirdML v2 current leaderboard · weirdml-v2-task-set
- Métrique / unité
- accuracy · percent
Agents et outils
Terminal-Bench 2.0
Terminal-Bench 2.0 leaderboard over 89 hard terminal tasks; agent harness and run date stay attached to every score.
- Source de comparaison
- Epoch AI mirror · Terminal-Bench 2.0
- Version / tâches
- Terminal-Bench 2.0 · official-89-task-set
- Métrique / unité
- accuracy_mean · percent
Terminal-Bench 2.1
Vals AI's independent Terminal-Bench 2.1 run with one uniform harness; vendor reports remain supplemental.
- Source de comparaison
- Vals AI · Terminal-Bench 2.1
- Version / tâches
- Vals Terminal-Bench 2.1 v2.1 · vals-terminal-bench-2-1-overall
- Métrique / unité
- accuracy · percent
Terminal-Bench 3.0
Classement officiel agent-modèle sur 74 tâches terminal difficiles ; agent, effort et nombre d’essais restent liés à chaque score.
- Source de comparaison
- Terminal-Bench 3.0
- Version / tâches
- 3.0 · b936386b-4afd-4ad7-aa7f-6b52bcab9853 · official-74-task-leaderboard
- Métrique / unité
- accuracy · percent
τ³-Banking · Official harness
Tâches bancaires conversationnelles exigeantes avec recherche, outils et utilisateur simulé, telles que publiées sur le classement officiel.
- Source de comparaison
- τ³-Banking
- Version / tâches
- 1.0.1 · banking_knowledge
- Métrique / unité
- pass_1 · percent
τ³-Banking · Artificial Analysis harness
Exécution propre à Artificial Analysis sur le même domaine : 97 tâches, recherche BM25/grep et un autre utilisateur simulé. Le simulateur fait partie de la mesure, d'où une colonne distincte et non un second avis.
- Source de comparaison
- Artificial Analysis · Intelligence Index evaluations
- Version / tâches
- τ³-Banking (Artificial Analysis) · banking-97-tasks-gpt-5-4-mini-simulator
- Métrique / unité
- pass_at_1 · percent
MCP-Atlas · Scale
Real-world multi-step tool use across 1,000 tasks, 36 MCP servers and 220 tools. The comparable lane uses Scale's April 2026 rescored protocol, all public and private tasks, a 100-tool-call budget and the exact row-specific publication date.
- Source de comparaison
- Scale AI Labs · MCP-Atlas
- Version / tâches
- MCP-Atlas April 2026 rescored protocol · all-1000-public-500-private-500
- Métrique / unité
- pass_rate · percent
SkillsBench v1.1
Benchmark d’agents audité sur 87 tâches professionnelles ; les protocoles avec et sans compétences restent séparés.
- Source de comparaison
- SkillsBench v1.1
- Version / tâches
- v1.1 · official-87-tasks-with-skills
- Métrique / unité
- pass_rate · percent
APEX-Agents
Travail professionnel à long horizon en banque, conseil et droit avec outils bureautiques et exécution de code.
- Source de comparaison
- Epoch AI mirror · APEX-Agents
- Version / tâches
- APEX-Agents current leaderboard · 480-professional-tasks-33-worlds
- Métrique / unité
- pass_at_1 · percent
Berkeley Function Calling Leaderboard V4
Appels de fonctions, utilisation d’outils en plusieurs tours et résistance aux hallucinations dans BFCL V4.
- Source de comparaison
- BFCL V4
- Version / tâches
- v4-ede5081a24bc · overall
- Métrique / unité
- overall_accuracy · percent
LMArena Agent Arena
Human preference evaluation of agent outcomes. Every score retains the submitted model, disclosed thinking label, confidence interval and observation count.
- Source de comparaison
- LMArena Agent Arena
- Version / tâches
- 2026-09-30 · overall-ips-aggregate
- Métrique / unité
- ips_score · ips
AppWorld
Interactive coding-agent benchmark across controllable applications and APIs; model, method, scaffold and task/scenario metrics remain attached to each run.
- Source de comparaison
- AppWorld official leaderboard
- Version / tâches
- official-c1f56015cf7c · test-challenge-all
- Métrique / unité
- task_goal_completion · percent
Vending-Bench 2
Long-horizon business simulation: mean final balance in USD after a simulated year.
- Source de comparaison
- Epoch AI mirror · Vending-Bench 2
- Version / tâches
- Vending-Bench 2 current leaderboard · one-simulated-year-mean-final-balance
- Métrique / unité
- mean_final_balance_usd · USD
GDPval-AA v2.1
Successor of GDPval-AA v2: the same 220 tasks and judges, Elo refitted and pinned to DeepSeek V4.1 Flash (max) at 1600 - not comparable with v2 values.
- Source de comparaison
- Artificial Analysis · Intelligence Index evaluations
- Version / tâches
- GDPval-AA v2.1 (Crowd-BT Elo, DeepSeek V4.1 Flash (max) at 1600) · 220-tasks-elo-v2-1
- Métrique / unité
- elo · points
Que peut-on déduire des données ?
Nous ne regardons pas seulement quel modèle obtient le plus de points. Ces analyses montrent où les preuves permettent une comparaison, où des mesures manquent et quelles conclusions iraient trop loin.
Les indicateurs sont calculés à partir du même état des données que le tableau. L’interprétation est celle de LLM Benchmarks ; les mesures proviennent des sources citées.
Comment utiliser ces analyses
Le choix des modèles et la disponibilité des tests publiés façonnent chaque analyse. Plus de preuves signifie davantage d’informations vérifiables, pas automatiquement un meilleur modèle. Chaque analyse précise donc son unité de comptage, son état des données et ses limites. Elle est recalculée avec le jeu de données publié et ne constitue pas une reproduction indépendante des tests.
Lire les comparaisons et études de cas →
01Petits modèles ouverts : quelles preuves pour les comparer ?
Choisir un petit modèle ouvert demande plus qu’un bon score isolé. Pour les modèles retenus de moins de 36 milliards de paramètres au total, nous examinons combien de couples modèle-benchmark sont documentés et disposent de preuves directement comparables.
Une couverture large facilite la présélection. Elle mesure les preuves disponibles, pas la qualité du modèle ni ses besoins en mémoire.
Quelle quantité de preuves est disponible ?
Un couple associe un modèle à un benchmark du tableau complet. Plusieurs niveaux de raisonnement ne comptent qu’une fois ; les études de quantification ne sont pas des preuves pour le modèle de base. « Comparable » exige au moins un résultat sans conflit ayant ce statut dans le tableau. Toutes les configurations de base recensées sont prises en compte, pas seulement la vue filtrée actuelle.
Chaque barre couvre tous les couples possibles du domaine. Nombres : comparables / documentés / possibles.
Notre comptage à partir des données publiques. Données au : . JSON · CSV
Qu’en déduire pour le choix du modèle ?
Chercher d’abord des preuves dans votre domaine. De nombreuses mesures de connaissances ne comblent pas une lacune sur les agents de programmation. Comparer ensuite les benchmarks communs aux candidats et vérifier leurs protocoles. Les nombres totaux de paramètres inconnus ne sont pas déduits des noms et n’ouvrent pas droit à l’inclusion dans cette analyse sous 36B.
Les parties claires du graphique représentent des lacunes de notre jeu de données. Un modèle peut avoir été testé ailleurs sans que nous disposions d’un résultat publiable. La sélection des modèles est également organisée. Les barres ne prouvent donc aucun avantage général des modèles ouverts ou fermés.
Reproduire l’analyse
Dans l’export JSON, sélectionner les modèles ouverts dont le nombre total documenté de paramètres est supérieur à zéro et inférieur à 36 milliards. Ne retenir que les benchmarks du site. Dédupliquer les preuves de base par modèle et benchmark, en séparant les variantes quantifiées. Les données incluent des résultats plus anciens toujours admissibles à la publication. Vérifier aussi les dates des mesures avant un choix d’utilisation.
02Même benchmark, conditions différentes
Deux scores publiés peuvent être exacts sans permettre de calculer un écart équitable. Nous comptons les couples modèle-benchmark disposant de preuves comparables et expliquons cette distinction avec nos protocoles d’évaluation.
Mesuré en commun ne signifie pas automatiquement directement comparable. Version, tâches et configuration doivent correspondre avant de calculer un écart.
Documenté ne signifie pas toujours comparable
L’analyse compte les couples parmi tous les modèles retenus et les benchmarks du site. Un couple est documenté dès qu’un résultat de base existe. Pour être comparable, il doit aussi disposer d’au moins un résultat sans conflit ayant le statut correspondant dans le tableau. Les autres couples ne possèdent que des preuves complémentaires ou non directement comparables. Les variantes de raisonnement ne sont pas comptées plusieurs fois.
Chaque barre couvre tous les couples possibles du domaine. Nombres : comparables / documentés / possibles.
Notre comptage à partir des données publiques. Données au : . JSON · CSV
Trois situations où un écart induit en erreur
SWE-bench : un modèle dans l’agent d’un fournisseur et un autre dans un environnement uniforme représentent d’abord deux systèmes. Notre comparaison stricte Verified utilise le protocole Vals défini. Pour Pro, les résultats de systèmes déclarés restent séparés du protocole directement comparable.
HLE : le jeu complet et le sous-ensemble textuel ont des dénominateurs différents. Les outils modifient aussi les méthodes de résolution autorisées. Un écart en points de pourcentage entre ces configurations n’isolerait pas le progrès du modèle.
SWE-rebench : des fenêtres de tâches différentes changent les problèmes à résoudre. Une ancienne fenêtre documentée peut former sa propre cohorte de comparaison. Son rang appartient à cette fenêtre et ne doit pas être assimilé à celui de la fenêtre actuelle.
Une comparaison défendable en trois étapes
Sélectionner deux à quatre modèles et un domaine pertinent. Limiter l’affichage aux benchmarks mesurés pour tous les modèles retenus. Examiner ensuite les indications de comparabilité et les détails avant d’interpréter les écarts au modèle de référence. Même un écart techniquement valide n’est pas un test de significativité statistique.
Notre conclusion : un résultat supplémentaire de fournisseur enrichit l’information sans créer automatiquement un nouveau rang équitable. Rendre cette distinction visible est plus utile que forcer tous les scores dans un classement unique.
03Plus de raisonnement ne garantit pas un meilleur score
Davantage de calcul est souvent assimilé à un meilleur résultat. Nous recherchons dans les données publiées des exemples où un niveau fixe de raisonnement supérieur obtient un score inférieur dans la même configuration d’évaluation divulguée.
Un contre-exemple remet en cause une amélioration garantie. Il ne signifie pas que moins de raisonnement soit généralement préférable.
Exemples dans cet état des données
Nous comparons des niveaux fixes documentés pour un même modèle, une même source, version de test, série de tâches, métrique, configuration d’outils, orchestration d’agent et procédure d’évaluation. Les tailles d’échantillon déclarées doivent aussi correspondre. Nous utilisons des preuves récentes et actuelles du protocole canonique, sans conflit ni avertissement de contamination. Les scores multiples ambigus à un même niveau sont exclus.
Claude Fable 5.1 · CritPt
CritPt current leaderboard · Epoch AI mirror · CritPt
Dates de référence des preuves: 2 septembre 2026 / 2 septembre 2026. Ne prouve pas un effet causal du raisonnement.
Claude Fable 5 · Vending 2
Vending-Bench 2 current leaderboard · Epoch AI mirror · Vending-Bench 2
Dates de référence des preuves: 2 septembre 2026 / 2 septembre 2026. Ne prouve pas un effet causal du raisonnement.
Claude Opus 4.7 · ARC-AGI-1
ARC-AGI-1 current leaderboard · Epoch AI mirror · ARC-AGI-1
Dates de référence des preuves: 2 septembre 2026 / 2 septembre 2026. Ne prouve pas un effet causal du raisonnement.
Ce que ces exemples permettent d’affirmer
Ces contre-exemples sont choisis intentionnellement ; ils ne constituent ni un échantillon représentatif ni une estimation de fréquence. Les dates de test et les réglages non divulgués peuvent encore jouer un rôle. Sans répétitions ni analyse appropriée de l’incertitude, la cause d’un écart ne peut pas être établie.
Notre tableau sélectionne donc par défaut le niveau documenté le plus élevé de la série choisie, plutôt que le meilleur score obtenu a posteriori parmi tous les niveaux. La règle est ainsi traçable. Pour votre application, tester ensemble qualité, temps de réponse et coût : les seuls scores de qualité présentés ici ne constituent pas un classement d’efficacité.
Qui gère ce site ?
LLM Benchmarks est un projet exploité à titre privé par Christopher Böhm. Il rassemble les évaluations publiées de modèles, leurs sources et leurs limites pour les comparer au même endroit.
Une sélection traçable nous importe davantage qu’un classement apparemment incontestable. Chaque comparaison doit permettre de remonter aux preuves.
Notre contribution
Nous rapprochons identités des modèles et versions des benchmarks, séparons les conditions de test différentes, signalons les données incertaines ou contradictoires et proposons des outils de comparaison et d’export. Les explications et analyses rendent ces décisions compréhensibles. Nous ne présentons pas les mesures de tiers comme nos propres tests.
Responsabilité et maintenance
Christopher Böhm est l’exploitant et l’interlocuteur du projet. La collecte des données et les contrôles techniques sont partiellement automatisés. Le projet maintient les règles de publication, l’attribution des sources et les preuves complémentaires sélectionnées. L’automatisation peut propager des erreurs : les liens vers les sources, les détails des mesures et le contact de correction font donc partie du service.
Financement et règles de sélection
L’exploitant accepte un soutien volontaire via PayPal. Le site est également préparé pour un emplacement publicitaire AdSense manuel. L’inclusion des modèles, le choix des mesures et les rangs suivent les règles décrites dans la méthodologie. Citer une source indique l’origine d’un résultat et ne constitue pas une recommandation de produit.
Contact et corrections
Vous avez repéré un score erroné, une mauvaise identification de modèle ou une limite manquante ? Envoyez le nom du modèle, le benchmark, l’information concernée et, si possible, une source originale. Les suggestions de tests publiés encore absents sont également bienvenues. Merci de ne pas transmettre de données confidentielles.