Trois modèles ouverts de moins de 36 milliards de paramètres
Qwen 3.8 27B, Qwen 3.6 35B-A3B et Gemma 4 31B IT constituent notre sélection éditoriale : deux fournisseurs et des architectures denses et MoE. Ce choix n’est pas un classement. Il faut d’abord vérifier l’existence de mesures comparables pour la même tâche.
Qwen 3.8 27B
Paramètres totaux: 27 milliards
Modèle dense
Qwen 3.6 35B-A3B
Paramètres totaux: 35 milliards
Paramètres actifs: 3 milliards
Mélange d’experts (MoE)
Gemma 4 31B IT
Paramètres totaux: 30,7 milliards
Modèle dense
Pour chaque modèle et test, nous reprenons le résultat de base choisi selon les règles du tableau. Variantes quantifiées, preuves anciennes ou non confirmées, conflits et alertes de contamination sont exclus. Dans chaque graphique, source, version, tâches, métrique, agent, outils et évaluation doivent correspondre. Les réglages de raisonnement restent visibles ; l’égalité des budgets de calcul n’est pas établie.
Échelle de 0 à 100 %. Seules les valeurs d’un même groupe partagent le protocole indiqué. Aucun avantage n’est calculé entre groupes.
GPQA
Vals AI GPQA Diamond · GPQA Diamond v1 · Vals dual-prompt · diamond-198-zero-and-five-shot-cot
Aucun résultat de base actuel ne respecte ces règles: Qwen 3.6 35B-A3B · Gemma 4 31B IT.
Guide des benchmarks →SciCode
Epoch AI mirror · SciCode · SciCode current leaderboard · scientific-research-coding-subproblems
Estimation ponctuelle affichée la plus élevée dans ce groupe: Qwen 3.8 27B.
LiveCodeBench
Vals AI · LiveCodeBench · Vals LiveCodeBench v1 · vals-livecodebench-overall
Aucun résultat de base actuel ne respecte ces règles: Qwen 3.6 35B-A3B · Gemma 4 31B IT.
Guide des benchmarks →Une estimation plus élevée ne prouve pas une supériorité statistique. Des différences non déclarées peuvent subsister.
GPQA renseigne sur la résolution de problèmes scientifiques. SciCode porte sur la programmation scientifique, LiveCodeBench sur la programmation de concours. Une avance sur GPQA ne dit donc pas quel modèle traitera mieux votre code. Choisissez d’abord votre domaine et comparez uniquement les valeurs d’un même groupe.
Notre conclusion : des preuves communes pertinentes aident davantage à sélectionner des candidats qu’une moyenne de ces trois tests. Sans mesure commune, l’incertitude demeure. Le nombre total de paramètres ne suffit à établir ni la mémoire nécessaire ni la vitesse d’une installation locale quantifiée.
Ouvrir ces trois modèles dans le tableau →