LLM Benchmarks

Mesures étayées par des sources

Analyses et études de modèles

Comparer de petits LLM ouverts à partir de mesures concrètes et interpréter différents résultats SWE-bench. Analyses originales, sources et limites explicites.

Trois modèles ouverts de moins de 36 milliards de paramètres

Qwen 3.8 27B, Qwen 3.6 35B-A3B et Gemma 4 31B IT constituent notre sélection éditoriale : deux fournisseurs et des architectures denses et MoE. Ce choix n’est pas un classement. Il faut d’abord vérifier l’existence de mesures comparables pour la même tâche.

Qwen 3.8 27B

Paramètres totaux: 27 milliards

Modèle dense

Qwen 3.6 35B-A3B

Paramètres totaux: 35 milliards

Paramètres actifs: 3 milliards

Mélange d’experts (MoE)

Gemma 4 31B IT

Paramètres totaux: 30,7 milliards

Modèle dense

Pour chaque modèle et test, nous reprenons le résultat de base choisi selon les règles du tableau. Variantes quantifiées, preuves anciennes ou non confirmées, conflits et alertes de contamination sont exclus. Dans chaque graphique, source, version, tâches, métrique, agent, outils et évaluation doivent correspondre. Les réglages de raisonnement restent visibles ; l’égalité des budgets de calcul n’est pas établie.

Échelle de 0 à 100 %. Seules les valeurs d’un même groupe partagent le protocole indiqué. Aucun avantage n’est calculé entre groupes.

GPQA

Preuve isolée — aucun partenaire comparable dans cette sélection
Vals AI GPQA Diamond · GPQA Diamond v1 · Vals dual-prompt · diamond-198-zero-and-five-shot-cot
Qwen 3.8 27B88,89 %
Effort de raisonnement: xhigh

Preuve originale: Vals AI GPQA Diamond ↗

Date du document ou de l’observation:

Aucun résultat de base actuel ne respecte ces règles: Qwen 3.6 35B-A3B · Gemma 4 31B IT.

Guide des benchmarks →

SciCode

Protocole déclaré commun
Epoch AI mirror · SciCode · SciCode current leaderboard · scientific-research-coding-subproblems
Qwen 3.8 27B46,6 %
Effort de raisonnement: xhigh

Preuve originale: Epoch AI mirror · SciCode ↗

Date du document ou de l’observation:

Qwen 3.6 35B-A3B1,3 %
Effort de raisonnement: off

Preuve originale: Epoch AI mirror · SciCode ↗

Date du document ou de l’observation:

Gemma 4 31B IT43,4 %
Effort de raisonnement: Non indiqué

Preuve originale: Epoch AI mirror · SciCode ↗

Date du document ou de l’observation:

Estimation ponctuelle affichée la plus élevée dans ce groupe: Qwen 3.8 27B.

Guide des benchmarks →

LiveCodeBench

Preuve isolée — aucun partenaire comparable dans cette sélection
Vals AI · LiveCodeBench · Vals LiveCodeBench v1 · vals-livecodebench-overall
Qwen 3.8 27B84 %
Effort de raisonnement: xhigh

Preuve originale: Vals AI · LiveCodeBench ↗

Date du document ou de l’observation:

Aucun résultat de base actuel ne respecte ces règles: Qwen 3.6 35B-A3B · Gemma 4 31B IT.

Guide des benchmarks →

Une estimation plus élevée ne prouve pas une supériorité statistique. Des différences non déclarées peuvent subsister.

GPQA renseigne sur la résolution de problèmes scientifiques. SciCode porte sur la programmation scientifique, LiveCodeBench sur la programmation de concours. Une avance sur GPQA ne dit donc pas quel modèle traitera mieux votre code. Choisissez d’abord votre domaine et comparez uniquement les valeurs d’un même groupe.

Notre conclusion : des preuves communes pertinentes aident davantage à sélectionner des candidats qu’une moyenne de ces trois tests. Sans mesure commune, l’incertitude demeure. Le nombre total de paramètres ne suffit à établir ni la mémoire nécessaire ni la vitesse d’une installation locale quantifiée.

Ouvrir ces trois modèles dans le tableau →

↑ Retour aux thèmes

Un même modèle, deux résultats SWE-bench

Claude Opus 5 montre pourquoi les noms du modèle et du test ne suffisent pas. Nous présentons l’exécution indépendante de Vals et le rapport complémentaire du fournisseur. Chaque résultat reste associé à sa source et à son protocole.

Exécution de comparaison uniforme

Claude Opus 5 · SWE-bench

97 %

Protocole déclaré

  • SWE-bench Verified v1
  • verified-500-vals-mini-swe-agent
  • Vals AI mini-swe-agent
  • Bash
  • Vals AI independent run over all 500 verified tasks; uniform minimal bash-only mini-swe-agent harness

Preuve originale: Vals AI SWE-bench Verified ↗

Date du document ou de l’observation:

Rapport complémentaire du fournisseur

Claude Opus 5 · SWE-bench

96 %

Protocole déclaré

  • Anthropic 500-task evaluation
  • verified-500
  • unspecified agentic harness
  • not reported
  • adaptive thinking; max effort; five-trial average

Preuve originale: Anthropic · Claude Opus 5 System Card ↗

Date du document ou de l’observation:

Vals indique mini-swe-agent et Bash. Le fournisseur décrit un autre protocole ou un protocole incomplet. Les indications de raisonnement et de répétitions diffèrent aussi. L’écart ne peut donc être attribué à une cause unique ; il ne prouve ni amélioration du modèle ni erreur d’une source.

Pour comparer plusieurs modèles, nous commencerions par le groupe uniforme de Vals. Le rapport du fournisseur apporte une preuve supplémentaire sur le système qu’il a testé. Votre usage nécessite encore un test sur votre dépôt, avec votre agent et des budgets fixes de temps et de tokens.

↑ Retour aux thèmes

Construire votre présélection

  1. Définissez votre tâche et choisissez deux à quatre candidats.
  2. Vérifiez les mesures communes et leurs protocoles ; gardez les lacunes explicites.
  3. Testez les modèles restants sur vos tâches : qualité, délai et coût.
Méthodologie et autres analyses →