Tres modelos abiertos con menos de 36 mil millones de parámetros
Qwen 3.8 27B, Qwen 3.6 35B-A3B y Gemma 4 31B IT forman nuestra muestra editorial: dos proveedores y arquitecturas densas y MoE. La selección no es una clasificación. Primero hay que comprobar si existen mediciones comparables para la misma tarea.
Qwen 3.8 27B
Parámetros totales: 27 mil millones
Modelo denso
Qwen 3.6 35B-A3B
Parámetros totales: 35 mil millones
Parámetros activos: 3 mil millones
Mezcla de expertos (MoE)
Gemma 4 31B IT
Parámetros totales: 30,7 mil millones
Modelo denso
Para cada modelo y prueba usamos el resultado base elegido según las reglas de la tabla. Excluimos variantes cuantizadas, pruebas antiguas o sin confirmación actual, conflictos y alertas de contaminación. En cada gráfico deben coincidir fuente, versión, tareas, métrica, agente, herramientas y evaluación. Los ajustes de razonamiento siguen visibles; esto no demuestra presupuestos de cómputo iguales.
Escala de 0 a 100 %. Solo los valores del mismo grupo comparten la configuración indicada. No calculamos ventajas entre grupos.
GPQA
Vals AI GPQA Diamond · GPQA Diamond v1 · Vals dual-prompt · diamond-198-zero-and-five-shot-cot
No hay un resultado base actual que cumpla estas reglas: Qwen 3.6 35B-A3B · Gemma 4 31B IT.
Guía de benchmarks →SciCode
Epoch AI mirror · SciCode · SciCode current leaderboard · scientific-research-coding-subproblems
Mayor estimación puntual mostrada dentro de este grupo: Qwen 3.8 27B.
LiveCodeBench
Vals AI · LiveCodeBench · Vals LiveCodeBench v1 · vals-livecodebench-overall
No hay un resultado base actual que cumpla estas reglas: Qwen 3.6 35B-A3B · Gemma 4 31B IT.
Guía de benchmarks →Un valor mayor no demuestra superioridad estadística. Las configuraciones declaradas pueden contener diferencias no publicadas.
GPQA aporta evidencia sobre problemas científicos. SciCode evalúa programación científica; LiveCodeBench, programación competitiva. Una ventaja en GPQA no determina qué modelo trabajará mejor con tu código. Elige primero el ámbito y compara valores solo dentro del mismo grupo.
Nuestra conclusión: las pruebas comunes relevantes ayudan más a preseleccionar que una media de estas tres pruebas. Sin una medición común sigue existiendo una laguna. El total de parámetros tampoco determina por sí solo la memoria necesaria ni la velocidad de una instalación local cuantizada.
Abrir estos tres modelos en la tabla comparativa →