LLM Benchmarks

Mediciones respaldadas por fuentes

Análisis y casos de modelos

Compara pequeños LLM abiertos con mediciones concretas e interpreta distintos resultados de SWE-bench. Análisis propios con fuentes y límites explícitos.

Tres modelos abiertos con menos de 36 mil millones de parámetros

Qwen 3.8 27B, Qwen 3.6 35B-A3B y Gemma 4 31B IT forman nuestra muestra editorial: dos proveedores y arquitecturas densas y MoE. La selección no es una clasificación. Primero hay que comprobar si existen mediciones comparables para la misma tarea.

Qwen 3.8 27B

Parámetros totales: 27 mil millones

Modelo denso

Qwen 3.6 35B-A3B

Parámetros totales: 35 mil millones

Parámetros activos: 3 mil millones

Mezcla de expertos (MoE)

Gemma 4 31B IT

Parámetros totales: 30,7 mil millones

Modelo denso

Para cada modelo y prueba usamos el resultado base elegido según las reglas de la tabla. Excluimos variantes cuantizadas, pruebas antiguas o sin confirmación actual, conflictos y alertas de contaminación. En cada gráfico deben coincidir fuente, versión, tareas, métrica, agente, herramientas y evaluación. Los ajustes de razonamiento siguen visibles; esto no demuestra presupuestos de cómputo iguales.

Escala de 0 a 100 %. Solo los valores del mismo grupo comparten la configuración indicada. No calculamos ventajas entre grupos.

GPQA

Prueba individual: sin otro modelo comparable en esta muestra
Vals AI GPQA Diamond · GPQA Diamond v1 · Vals dual-prompt · diamond-198-zero-and-five-shot-cot
Qwen 3.8 27B88,89 %
Esfuerzo de razonamiento: xhigh

Prueba original: Vals AI GPQA Diamond ↗

Fecha de la fuente u observación:

No hay un resultado base actual que cumpla estas reglas: Qwen 3.6 35B-A3B · Gemma 4 31B IT.

Guía de benchmarks →

SciCode

Configuración declarada compartida
Epoch AI mirror · SciCode · SciCode current leaderboard · scientific-research-coding-subproblems
Qwen 3.8 27B46,6 %
Esfuerzo de razonamiento: xhigh

Prueba original: Epoch AI mirror · SciCode ↗

Fecha de la fuente u observación:

Qwen 3.6 35B-A3B1,3 %
Esfuerzo de razonamiento: off

Prueba original: Epoch AI mirror · SciCode ↗

Fecha de la fuente u observación:

Gemma 4 31B IT43,4 %
Esfuerzo de razonamiento: No indicado

Prueba original: Epoch AI mirror · SciCode ↗

Fecha de la fuente u observación:

Mayor estimación puntual mostrada dentro de este grupo: Qwen 3.8 27B.

Guía de benchmarks →

LiveCodeBench

Prueba individual: sin otro modelo comparable en esta muestra
Vals AI · LiveCodeBench · Vals LiveCodeBench v1 · vals-livecodebench-overall
Qwen 3.8 27B84 %
Esfuerzo de razonamiento: xhigh

Prueba original: Vals AI · LiveCodeBench ↗

Fecha de la fuente u observación:

No hay un resultado base actual que cumpla estas reglas: Qwen 3.6 35B-A3B · Gemma 4 31B IT.

Guía de benchmarks →

Un valor mayor no demuestra superioridad estadística. Las configuraciones declaradas pueden contener diferencias no publicadas.

GPQA aporta evidencia sobre problemas científicos. SciCode evalúa programación científica; LiveCodeBench, programación competitiva. Una ventaja en GPQA no determina qué modelo trabajará mejor con tu código. Elige primero el ámbito y compara valores solo dentro del mismo grupo.

Nuestra conclusión: las pruebas comunes relevantes ayudan más a preseleccionar que una media de estas tres pruebas. Sin una medición común sigue existiendo una laguna. El total de parámetros tampoco determina por sí solo la memoria necesaria ni la velocidad de una instalación local cuantizada.

Abrir estos tres modelos en la tabla comparativa →

↑ Volver a los temas

El mismo modelo, dos resultados de SWE-bench

Claude Opus 5 ilustra por qué no bastan los nombres del modelo y la prueba. Presentamos la ejecución independiente de Vals junto al informe complementario del proveedor. Cada resultado permanece vinculado a su fuente y configuración.

Ejecución de comparación uniforme

Claude Opus 5 · SWE-bench

97 %

Configuración declarada

  • SWE-bench Verified v1
  • verified-500-vals-mini-swe-agent
  • Vals AI mini-swe-agent
  • Bash
  • Vals AI independent run over all 500 verified tasks; uniform minimal bash-only mini-swe-agent harness

Prueba original: Vals AI SWE-bench Verified ↗

Fecha de la fuente u observación:

Informe complementario del proveedor

Claude Opus 5 · SWE-bench

96 %

Configuración declarada

  • Anthropic 500-task evaluation
  • verified-500
  • unspecified agentic harness
  • not reported
  • adaptive thinking; max effort; five-trial average

Prueba original: Anthropic · Claude Opus 5 System Card ↗

Fecha de la fuente u observación:

Vals indica mini-swe-agent y Bash. El proveedor describe una configuración diferente o incompleta. También difieren los datos sobre razonamiento y repeticiones. Por tanto, la diferencia no puede atribuirse a una única causa; no demuestra una mejora del modelo ni un error de alguna fuente.

Para comparar modelos empezaríamos por el grupo uniforme de Vals. El informe del proveedor aporta evidencia adicional sobre el sistema probado allí. Tu uso aún requiere pruebas con tu repositorio, tu agente y presupuestos fijos de tiempo y tokens.

↑ Volver a los temas

Cómo elaborar tu preselección

  1. Define la tarea y selecciona entre dos y cuatro candidatos.
  2. Comprueba las mediciones comunes y sus configuraciones; deja claras las lagunas.
  3. Evalúa los modelos restantes con tus tareas: calidad, latencia y coste.
Metodología y otros análisis →