LLM Benchmarks

Mediciones respaldadas por fuentes

Guías y metodología

Entiende los benchmarks, compara las mediciones de forma justa y consulta las fuentes de LLM Benchmarks. Metodología, guía de pruebas y análisis basados en datos.

¿De dónde salen las puntuaciones?

Un resultado resulta útil cuando sabemos qué modelo se probó y en qué condiciones. Aquí explicamos cómo seleccionamos, comprobamos y presentamos los resultados publicados en la tabla comparativa.

Nuestra aportación consiste en reunir y comprobar la evidencia. Las evaluaciones originales las realizan los responsables de los benchmarks y los proveedores de modelos enlazados.

1. ¿Qué modelos y fuentes se incluyen?

La selección combina modelos del Epoch Capabilities Index con otras evaluaciones exigentes, lanzamientos recientes de proveedores que hemos verificado y una cuota dedicada a modelos abiertos. Así se incluyen modelos pequeños poco representados en las grandes clasificaciones. Es una muestra del mercado, no un directorio completo.

Utilizamos resultados de los responsables de los benchmarks, evaluaciones independientes e informes documentados de proveedores. La identidad del modelo, la fuente, la versión de la prueba y las condiciones de publicación deben poder rastrearse. Un resultado de acceso público no está automáticamente autorizado para su republicación. Los informes de proveedores conservan su atribución.

2. ¿Cuándo son comparables dos resultados?

El nombre del benchmark no basta. Consideramos la edición, la versión, el conjunto o período de tareas, la métrica, la unidad, las herramientas, la configuración del agente y el procedimiento de evaluación. Cada benchmark tiene un protocolo de comparación definido. Otras configuraciones pueden aportar evidencia útil, pero no reciben implícitamente el mismo estatus en la clasificación.

  • Puesto: posición dentro del protocolo admisible del benchmark; no es un veredicto global sobre el modelo.
  • ≈: evidencia complementaria obtenida en otras condiciones. Consultar primero los detalles de la medición.
  • Conflicto: fuentes fiables discrepan para una misma configuración documentada. No hay un puesto único fiable.
  • Celda vacía: no hay una medición visible que corresponda. No significa cero puntos ni una evaluación fallida.

3. ¿Qué nivel de razonamiento se selecciona?

Dentro de la misma fuente y serie de pruebas, preferimos el nivel fijo documentado más alto: max, xhigh, high, medium, low, minimal, off. No escogemos después el resultado que tenga más puntos. Por tanto, una ejecución Max válida puede puntuar menos que High. No mezclamos agentes, versiones o conjuntos de tareas para obtener un nivel superior.

Adaptive indica que el razonamiento está activado, pero no demuestra un presupuesto máximo fijo. Los ajustes no revelados siguen siendo desconocidos. La etiqueta High de dos proveedores no implica necesariamente el mismo presupuesto de cálculo.

4. ¿Qué significan las fechas y categorías de fuentes?

La fecha de evaluación, la publicación, la versión de los datos y la primera observación son hechos distintos. Si una fuente no fecha una ejecución, podemos utilizar la primera vez que se observó ese resultado exacto. Eso no demuestra que la evaluación sea reciente. Los detalles indican en qué se basa la fecha.

La autoridad de la fuente y la calidad de la evidencia se evalúan por separado. A+, A, B y C son nuestras categorías de fuentes y evidencia, no probabilidades estadísticas de que un resultado sea correcto. Una buena categoría de fuente no elimina las diferencias entre condiciones de prueba.

5. Lo que la tabla no permite demostrar

Las diferencias pequeñas no demuestran una ventaja de rendimiento sin un análisis adecuado de incertidumbre. Los puntos porcentuales no son una mejora porcentual relativa. Un índice compuesto mide algo distinto del éxito en una tarea concreta; no promediamos las columnas para crear una puntuación global propia.

Los resultados de cuantización y hardware siguen siendo estudios complementarios. Distintos motores de ejecución, GPU o subconjuntos de tareas impiden aislar el efecto de la cuantización. El tamaño de los archivos de pesos, la capacidad de la GPU y la memoria realmente utilizada son magnitudes distintas. Las pruebas de hardware publicadas no son mediciones de laboratorio realizadas por LLM Benchmarks.

6. Comprobar la evidencia y comunicar errores

Abre una celda para consultar su fuente, configuración, fecha y variantes de razonamiento. Los datos pueden descargarse en CSV y JSON. Para comunicar un error, indica el modelo, el benchmark, el valor afectado y un enlace a la evidencia original. Las fuentes modificadas se comprueban de nuevo según las reglas de publicación; los errores confirmados se corrigen en los datos.

¿Qué mide cada benchmark?

La métrica útil depende de tu tarea. Un índice general, una prueba de conocimientos y una evaluación de agentes de programación miden cosas distintas. Esta guía ayuda a interpretar cada tipo de resultado.

Empieza por la tarea, comprueba el protocolo de evaluación y después compara los resultados.

Capacidad general: ECI e índices compuestos

El Epoch Capabilities Index combina resultados de distintas pruebas en una escala común de capacidades. Ofrece una primera visión de varios ámbitos. Su valor no es el porcentaje de tareas resueltas. Los datos nuevos pueden cambiar las estimaciones incluso de modelos que no han cambiado.

Nuestra interpretación: utiliza un índice para preseleccionar modelos y después revisa las pruebas pertinentes para tu trabajo. Un asistente especializado puede encajar aunque tenga un índice general inferior. No deben restarse puntuaciones de índices distintos.

Conocimientos y razonamiento: GPQA, HLE y matemáticas

GPQA contiene preguntas difíciles de biología, física y química elaboradas por especialistas. La tabla utiliza su subconjunto Diamond. Estas pruebas aportan evidencia sobre la resolución de problemas en las condiciones indicadas. No miden automáticamente la fiabilidad en investigaciones abiertas.

El conjunto HLE completo y su subconjunto de texto permanecen separados. El acceso a herramientas puede cambiar la tarea. En matemáticas importa la dificultad: un buen resultado en un conjunto antiguo o más fácil no demuestra rendimiento en tareas nuevas y difíciles. Para una aplicación de conocimientos también probaríamos tus propias preguntas con fuentes verificables.

Programación: ¿una tarea aislada o un agente completo?

Una evaluación de programación puede probar un problema autónomo o un agente que trabaja en un repositorio existente. SWE-bench evalúa incidencias reales de software. Las herramientas, la orquestación del agente y el entorno de prueba también influyen en el resultado.

Nuestra interpretación: al elegir un agente de programación, compara configuraciones de sistemas documentadas. Para funciones individuales puede ser más pertinente una prueba acotada. Verified, Pro y los conjuntos cambiantes de Rebench no son intercambiables. El éxito en un conjunto no predice el éxito en tu repositorio.

Agentes y herramientas: el proceso forma parte de la prueba

Las evaluaciones de terminal, uso de herramientas y agentes de varios turnos exigen actuar en un entorno definido. Las API disponibles, la configuración del agente y los límites de tiempo y llamadas forman parte del significado del resultado. Por ejemplo, las dos configuraciones Banking permanecen separadas en la tabla.

Nuestra interpretación: estos resultados son especialmente útiles si la prueba se parece a tu proceso. De lo contrario, quedan sin evaluar aspectos esenciales como permisos, recuperación tras errores y criterios propios de éxito. Revisa los detalles y prueba una pequeña selección de situaciones representativas de tu uso.

Interpretar pruebas de instrucciones y preferencias

IFEval evalúa instrucciones objetivamente verificables, como restricciones de salida. Es útil cuando tu proceso depende del cumplimiento de requisitos concretos. No demuestra una exactitud factual general ni la calidad especializada de todas las respuestas.

Las clasificaciones Arena reflejan preferencias según su procedimiento de comparación. Una respuesta preferida no es necesariamente correcta. Nuestra interpretación: las preferencias pueden orientar decisiones sobre estilo de escritura; verificar la exactitud requiere además comprobaciones específicas del ámbito.

Todos los benchmarks de la tabla comparativa

El siguiente directorio enlaza las páginas originales e indica nuestros protocolos de comparación. La versión y las tareas importan más que unos nombres parecidos. La agrupación sirve para orientarse; no pondera una clasificación global.

Resumen

Epoch Capabilities Index

Índice compuesto de capacidades ajustado por Epoch AI a partir de más de 50 benchmarks.

Fuente de comparación
Epoch Capabilities Index
Versión / tareas
Epoch ECI snapshot 2026-10-01 · official-composite-fit
Métrica / unidad
eci · index_points
Página original del benchmark ↗
Artificial Analysis Intelligence Index

Artificial Analysis' composite Intelligence Index; one value per model and reasoning setting. The protocol identifies the methodology version.

Fuente de comparación
Artificial Analysis · Intelligence Index evaluations
Versión / tareas
Artificial Analysis Intelligence Index v4.3 · intelligence-index-v4-3
Métrica / unidad
index_score · points
Página original del benchmark ↗
Arena Text

Clasificación de modelos de texto según preferencias humanas.

Fuente de comparación
Arena Text
Versión / tareas
2026-09-30 · overall-style-control
Métrica / unidad
arena_score · points
Página original del benchmark ↗
LiveBench

Evaluación objetiva de capacidades amplias, actualizada con frecuencia.

Fuente de comparación
LiveBench
Versión / tareas
2026-06-25 · overall-seven-category
Métrica / unidad
category_balanced_average · percent
Página original del benchmark ↗

Conocimiento y razonamiento

Humanity's Last Exam · Full multimodal

Los valores comparables usan el protocolo multimodal completo de 2.500 preguntas sin herramientas; los demás protocolos permanecen separados.

Fuente de comparación
Scale AI Labs · Humanity's Last Exam Full
Versión / tareas
HLE finalized 2,500 · Scale protocol 2025-04-03 · full-multimodal-2500-no-tools
Métrica / unidad
accuracy · percent
Página original del benchmark ↗
Humanity's Last Exam · Text-only

Subconjunto de solo texto de Artificial Analysis: 2.158 de las 2.500 preguntas, sin herramientas. Un conjunto de preguntas distinto, no una medición más débil del protocolo completo.

Fuente de comparación
Artificial Analysis · Intelligence Index evaluations
Versión / tareas
HLE text-only (Artificial Analysis) · text-only-2158-no-tools
Métrica / unidad
accuracy · percent
Página original del benchmark ↗
SimpleQA Verified

Conocimiento factual de respuesta corta y calidad de la abstención.

Fuente de comparación
Epoch AI SimpleQA Verified
Versión / tareas
Epoch independent Inspect runs · verified-1000-epoch-inspect
Métrica / unidad
accuracy · percent
Página original del benchmark ↗
GPQA Diamond

Preguntas científicas de nivel universitario avanzado sobre física, química y biología.

Fuente de comparación
Vals AI GPQA Diamond
Versión / tareas
GPQA Diamond v1 · Vals dual-prompt · diamond-198-zero-and-five-shot-cot
Métrica / unidad
accuracy · percent
Página original del benchmark ↗
MMLU-Pro

Broad academic multiple-choice knowledge and reasoning across fourteen subjects; Vals AI's independent run over the MMLU-Pro set.

Fuente de comparación
Vals AI · MMLU-Pro
Versión / tareas
Vals MMLU-Pro v1 · vals-mmlu-pro-overall
Métrica / unidad
accuracy · percent
Página original del benchmark ↗
FrontierMath T1–3

Evaluaciones independientes de Epoch AI sobre 295 problemas de matemáticas avanzadas; el nivel 4 permanece separado.

Fuente de comparación
Epoch AI · FrontierMath Tiers 1–3 v2
Versión / tareas
2.0.0 · private-285-of-295-problem-tiers-1-3-set
Métrica / unidad
mean_score · percent
Página original del benchmark ↗
ARC-AGI-2

Inducción de reglas abstractas en 360 tareas, con variantes pass@2 separadas por esfuerzo.

Fuente de comparación
ARC-AGI-2
Versión / tareas
v2 · semi-private-120
Métrica / unidad
accuracy · percent
Página original del benchmark ↗
FrontierMath T4

Independent Epoch AI runs on the 41 private research-level problems from the 43-problem FrontierMath Tier 4 v2 set; the two public examples and Tiers 1–3 are not mixed into this column.

Fuente de comparación
Epoch AI · FrontierMath Tier 4 v2
Versión / tareas
2.0.0 · private-41-of-43-problem-tier-4-set
Métrica / unidad
mean_score · percent
Página original del benchmark ↗
MMMU-Pro

Conocimiento experto y razonamiento multimodal.

Fuente de comparación
Vals AI · MMMU-Pro
Versión / tareas
Vals MMMU-Pro v1 · vals-mmmu-pro-overall
Métrica / unidad
accuracy · percent
Página original del benchmark ↗
CritPt

Research-level physics reasoning across 71 open-ended challenges graded automatically.

Fuente de comparación
Artificial Analysis · Intelligence Index evaluations
Versión / tareas
CritPt (Artificial Analysis) · 70-challenges-official-grading
Métrica / unidad
accuracy · percent
Página original del benchmark ↗
SimpleBench

Trick-question common-sense reasoning where humans still beat frontier models; average of five runs.

Fuente de comparación
Epoch AI mirror · SimpleBench
Versión / tareas
SimpleBench current leaderboard · official-set-avg-at-5
Métrica / unidad
accuracy_avg_at_5 · percent
Página original del benchmark ↗
Chess Puzzles

Epoch AI's 100 engine-generated chess puzzles with one best move each, run and dated by Epoch.

Fuente de comparación
Epoch AI · Chess Puzzles
Versión / tareas
Epoch AI Chess Puzzles v1 · 100-engine-generated-single-best-move-puzzles
Métrica / unidad
mean_score · percent
Página original del benchmark ↗
ARC-AGI-1

Original ARC-AGI abstraction puzzles on the semi-private set as reported by ARC Prize.

Fuente de comparación
Epoch AI mirror · ARC-AGI-1
Versión / tareas
ARC-AGI-1 current leaderboard · semi-private-evaluation-pass-at-2
Métrica / unidad
pass_at_2_accuracy · percent
Página original del benchmark ↗
IFEval

Instruction following. Provider reports and subset studies retain their scoring and sample-set labels; they do not form a uniform cross-model ranking.

Resultados complementarios; no se especifica un protocolo canónico común.

Página original del benchmark ↗
IFBench

Cumplimiento preciso de instrucciones: 300 prompts con 344 restricciones verificables, precisión estricta por instrucción según el Swallow LLM Leaderboard.

Fuente de comparación
Swallow LLM Leaderboard
Versión / tareas
swallow-evaluation-instruct · ifbench-test-300-prompts-344-instructions
Métrica / unidad
inst_level_strict_acc · percent
Página original del benchmark ↗

Código

SWE-bench Verified

Tasa de resolución de 500 problemas reales de software verificados; la comparación principal usa un agente mínimo uniforme.

Fuente de comparación
Vals AI SWE-bench Verified
Versión / tareas
SWE-bench Verified v1 · verified-500-vals-mini-swe-agent
Métrica / unidad
resolved_rate · percent
Página original del benchmark ↗
SWE-rebench v2

Resolución reciente de problemas de software dentro de una ventana temporal.

Fuente de comparación
SWE-rebench
Versión / tareas
rolling-v2 · 2026-05-15/2026-07-01
Métrica / unidad
resolved_rate · percent
Página original del benchmark ↗
SWE-bench-Live · Lite

Resolución de software actualizada continuamente, conservando agente, modelo y esfuerzo declarado.

Fuente de comparación
SWE-bench-Live · Lite
Versión / tareas
SWE-bench-Live Lite · lite-300-python
Métrica / unidad
resolved_rate · percent
Página original del benchmark ↗
DeepSWE

Tareas originales de ingeniería de software de largo alcance, con resultados separados por agente y nivel de razonamiento.

Fuente de comparación
DeepSWE official live leaderboard
Versión / tareas
DeepSWE v1.1 live leaderboard · 113-original-long-horizon-tasks
Métrica / unidad
pass_at_1 · percent
Página original del benchmark ↗
SWE-bench Pro Public · Scale

Scale AI Labs' separate 731-task professional software-engineering benchmark. Results keep the submitted model, agent label, confidence interval and row-specific publication date; they are never mixed with SWE-bench Verified, SWE-rebench or vendor supplemental protocols. A July 2026 OpenAI audit reported substantial task-quality concerns, so SWE-Pro should be read as one imperfect signal rather than an absolute model ranking.

Fuente de comparación
Scale AI Labs · SWE-bench Pro Public
Versión / tareas
Scale public 731-task leaderboard · public-731
Métrica / unidad
resolved_rate · percent
Página original del benchmark ↗
CursorBench

Evaluación de agentes de código con niveles explícitos de razonamiento y metadatos de coste, tokens y pasos.

Fuente de comparación
Epoch AI mirror · CursorBench
Versión / tareas
CursorBench current leaderboard · official-current-suite
Métrica / unidad
score · percent
Página original del benchmark ↗
FrontierCode 1.1 · Main

Tareas de código difíciles centradas en la integración, conservando agente y nivel de razonamiento.

Fuente de comparación
Epoch AI mirror · FrontierCode 1.1
Versión / tareas
FrontierCode 1.1 · main-100-hardest-tasks
Métrica / unidad
mergeability_rubric_mean_at_5 · percent
Página original del benchmark ↗
IOI

IOI 2024 and 2025 olympiad problems evaluated by Vals AI with olympiad graders.

Fuente de comparación
Vals AI · IOI
Versión / tareas
Vals IOI v2 · vals-ioi-2024-2026-overall
Métrica / unidad
score · percent
Página original del benchmark ↗
LiveCodeBench

Competitive programming problems released after training cutoffs; Vals AI's independent implementation, overall pass@1.

Fuente de comparación
Vals AI · LiveCodeBench
Versión / tareas
Vals LiveCodeBench v1 · vals-livecodebench-overall
Métrica / unidad
pass_at_1 · percent
Página original del benchmark ↗
SciCode

Programación científica medida por precisión de subproblemas con pruebas Python ejecutables.

Fuente de comparación
Epoch AI mirror · SciCode
Versión / tareas
SciCode current leaderboard · scientific-research-coding-subproblems
Métrica / unidad
subproblem_accuracy · percent
Página original del benchmark ↗
ALE-Bench

Score-based algorithmic optimisation contests (AtCoder Heuristic); performance rating.

Fuente de comparación
Epoch AI mirror · ALE-Bench
Versión / tareas
ALE-Bench current leaderboard · atcoder-heuristic-contest-set
Métrica / unidad
performance_rating · points
Página original del benchmark ↗
Vibe Code Bench

Building complete web applications from scratch in an agent harness, evaluated by Vals AI.

Fuente de comparación
Vals AI · Vibe Code Bench
Versión / tareas
Vals Vibe Code Bench v1.1 · vals-vibe-code-bench-overall
Métrica / unidad
score · percent
Página original del benchmark ↗
Text Arena · Coding

Preferencias humanas para aplicaciones web generadas con React y TypeScript.

Fuente de comparación
Epoch AI mirror · Text Arena (Coding)
Versión / tareas
Text Arena Coding current pool · text-arena-coding-bradley-terry
Métrica / unidad
bradley_terry_rating · points
Página original del benchmark ↗
WeirdML

Unusual machine-learning tasks solved end-to-end by writing and running code.

Fuente de comparación
Epoch AI mirror · WeirdML
Versión / tareas
WeirdML v2 current leaderboard · weirdml-v2-task-set
Métrica / unidad
accuracy · percent
Página original del benchmark ↗

Agentes y herramientas

Terminal-Bench 2.0

Terminal-Bench 2.0 leaderboard over 89 hard terminal tasks; agent harness and run date stay attached to every score.

Fuente de comparación
Epoch AI mirror · Terminal-Bench 2.0
Versión / tareas
Terminal-Bench 2.0 · official-89-task-set
Métrica / unidad
accuracy_mean · percent
Página original del benchmark ↗
Terminal-Bench 2.1

Vals AI's independent Terminal-Bench 2.1 run with one uniform harness; vendor reports remain supplemental.

Fuente de comparación
Vals AI · Terminal-Bench 2.1
Versión / tareas
Vals Terminal-Bench 2.1 v2.1 · vals-terminal-bench-2-1-overall
Métrica / unidad
accuracy · percent
Página original del benchmark ↗
Terminal-Bench 3.0

Clasificación oficial de agente y modelo en 74 tareas difíciles de terminal; agente, esfuerzo e intentos permanecen ligados a cada puntuación.

Fuente de comparación
Terminal-Bench 3.0
Versión / tareas
3.0 · b936386b-4afd-4ad7-aa7f-6b52bcab9853 · official-74-task-leaderboard
Métrica / unidad
accuracy · percent
Página original del benchmark ↗
τ³-Banking · Official harness

Tareas bancarias de varios turnos que requieren conocimiento, recuperación, herramientas y un usuario simulado, según la clasificación oficial.

Fuente de comparación
τ³-Banking
Versión / tareas
1.0.1 · banking_knowledge
Métrica / unidad
pass_1 · percent
Página original del benchmark ↗
τ³-Banking · Artificial Analysis harness

Ejecución propia de Artificial Analysis sobre el mismo dominio: 97 tareas, recuperación BM25/grep y otro usuario simulado. El simulador forma parte de la medición, por eso es una columna aparte y no una segunda opinión.

Fuente de comparación
Artificial Analysis · Intelligence Index evaluations
Versión / tareas
τ³-Banking (Artificial Analysis) · banking-97-tasks-gpt-5-4-mini-simulator
Métrica / unidad
pass_at_1 · percent
Página original del benchmark ↗
MCP-Atlas · Scale

Real-world multi-step tool use across 1,000 tasks, 36 MCP servers and 220 tools. The comparable lane uses Scale's April 2026 rescored protocol, all public and private tasks, a 100-tool-call budget and the exact row-specific publication date.

Fuente de comparación
Scale AI Labs · MCP-Atlas
Versión / tareas
MCP-Atlas April 2026 rescored protocol · all-1000-public-500-private-500
Métrica / unidad
pass_rate · percent
Página original del benchmark ↗
SkillsBench v1.1

Benchmark auditado de agentes en 87 tareas profesionales; los protocolos con y sin habilidades permanecen separados.

Fuente de comparación
SkillsBench v1.1
Versión / tareas
v1.1 · official-87-tasks-with-skills
Métrica / unidad
pass_rate · percent
Página original del benchmark ↗
APEX-Agents

Trabajo profesional de largo alcance en banca, consultoría y derecho con herramientas de oficina y ejecución de código.

Fuente de comparación
Epoch AI mirror · APEX-Agents
Versión / tareas
APEX-Agents current leaderboard · 480-professional-tasks-33-worlds
Métrica / unidad
pass_at_1 · percent
Página original del benchmark ↗
Berkeley Function Calling Leaderboard V4

Llamadas a funciones, uso de herramientas en varios turnos y resistencia a alucinaciones en BFCL V4.

Fuente de comparación
BFCL V4
Versión / tareas
v4-ede5081a24bc · overall
Métrica / unidad
overall_accuracy · percent
Página original del benchmark ↗
LMArena Agent Arena

Human preference evaluation of agent outcomes. Every score retains the submitted model, disclosed thinking label, confidence interval and observation count.

Fuente de comparación
LMArena Agent Arena
Versión / tareas
2026-09-30 · overall-ips-aggregate
Métrica / unidad
ips_score · ips
Página original del benchmark ↗
AppWorld

Interactive coding-agent benchmark across controllable applications and APIs; model, method, scaffold and task/scenario metrics remain attached to each run.

Fuente de comparación
AppWorld official leaderboard
Versión / tareas
official-c1f56015cf7c · test-challenge-all
Métrica / unidad
task_goal_completion · percent
Página original del benchmark ↗
Vending-Bench 2

Long-horizon business simulation: mean final balance in USD after a simulated year.

Fuente de comparación
Epoch AI mirror · Vending-Bench 2
Versión / tareas
Vending-Bench 2 current leaderboard · one-simulated-year-mean-final-balance
Métrica / unidad
mean_final_balance_usd · USD
Página original del benchmark ↗
GDPval-AA v2.1

Successor of GDPval-AA v2: the same 220 tasks and judges, Elo refitted and pinned to DeepSeek V4.1 Flash (max) at 1600 - not comparable with v2 values.

Fuente de comparación
Artificial Analysis · Intelligence Index evaluations
Versión / tareas
GDPval-AA v2.1 (Crowd-BT Elo, DeepSeek V4.1 Flash (max) at 1600) · 220-tasks-elo-v2-1
Métrica / unidad
elo · points
Página original del benchmark ↗

¿Qué nos dicen realmente los datos?

No nos limitamos a mirar qué modelo obtiene más puntos. Estos análisis muestran dónde la evidencia sostiene una comparación, dónde faltan mediciones y qué conclusiones serían excesivas.

Los indicadores se calculan con el mismo estado de los datos que la tabla. La interpretación es de LLM Benchmarks; las mediciones proceden de las fuentes citadas.

Cómo utilizar estos análisis

La selección de modelos y la disponibilidad de pruebas publicadas condicionan cada análisis. Más evidencia significa más información verificable, no automáticamente un modelo mejor. Cada informe indica su unidad de recuento, fecha de los datos y limitaciones. Los informes se recalculan con el conjunto publicado y no son repeticiones independientes de las pruebas.

Leer comparaciones concretas y casos prácticos →

01

Modelos abiertos pequeños: ¿qué evidencia respalda la comparación?

Elegir un modelo abierto pequeño exige más que un buen resultado aislado. Para los modelos seleccionados con menos de 36.000 millones de parámetros totales, examinamos cuántos pares modelo-benchmark tienen evidencia y dónde es directamente comparable.

Una cobertura amplia facilita la preselección. Mide la evidencia disponible, no la calidad del modelo ni sus necesidades de memoria.

¿Cuánta evidencia hay disponible?

Un par combina un modelo y un benchmark de la tabla completa. Varios niveles de razonamiento cuentan una sola vez; los estudios de cuantización no cuentan como evidencia del modelo base. «Comparable» exige al menos un resultado sin conflictos con ese estatus en la tabla. Se consideran todas las configuraciones base registradas, no solo la vista filtrada actual.

11modelos seleccionados
171 / 506pares modelo-benchmark documentados
100con evidencia comparable
Cobertura de mediciones por ámbito

Cada barra abarca todos los pares posibles de su ámbito. Cifras: comparables / documentados / posibles.

Resumen19 / 19 / 44
Conocimiento y razonamiento34 / 71 / 165
Código27 / 46 / 154
Agentes y herramientas20 / 35 / 143
Evidencia comparableSolo evidencia adicionalSin evidencia registrada

Recuento propio a partir de los datos públicos. Datos del: . JSON · CSV

¿Qué implica para elegir un modelo?

Busca primero evidencia en tu ámbito. Muchas mediciones de conocimientos no cubren una carencia en agentes de programación. Compara después los benchmarks comunes a tus candidatos y revisa sus protocolos. Los parámetros totales desconocidos no se deducen de los nombres y no permiten entrar en este análisis de menos de 36B.

Las partes claras del gráfico son lagunas de información en nuestros datos. Un modelo puede haberse evaluado en otro lugar sin que dispongamos de un registro publicable. La selección de modelos también está organizada. Por tanto, las barras no demuestran una ventaja general de modelos abiertos o cerrados.

Reproducir el análisis

En el JSON, selecciona modelos abiertos con un total documentado de parámetros mayor que cero y menor que 36.000 millones. Incluye solo benchmarks del sitio. Deduplica la evidencia base por modelo y benchmark y separa las variantes cuantizadas. El conjunto incluye resultados antiguos que siguen siendo publicables. Comprueba además las fechas individuales antes de decidir qué utilizar.

02

Mismo benchmark, condiciones distintas

Dos resultados publicados pueden ser correctos sin permitir calcular una diferencia justa. Contamos cuántos pares modelo-benchmark tienen evidencia comparable y explicamos la distinción mediante nuestros protocolos de evaluación.

Medido en común no significa automáticamente directamente comparable. La versión, las tareas y la configuración deben coincidir antes de calcular diferencias.

Documentado no siempre significa comparable

El análisis cuenta pares entre todos los modelos seleccionados y los benchmarks del sitio. Un par está documentado cuando existe al menos un resultado base. Para ser comparable necesita además un resultado sin conflictos con el estatus correspondiente en la tabla. El resto solo contiene evidencia complementaria o no directamente comparable. Las variantes de razonamiento no se cuentan varias veces.

100modelos seleccionados
2221 / 4600pares modelo-benchmark documentados
1991con evidencia comparable
Cobertura de mediciones por ámbito

Cada barra abarca todos los pares posibles de su ámbito. Cifras: comparables / documentados / posibles.

Resumen275 / 275 / 400
Conocimiento y razonamiento705 / 816 / 1500
Código589 / 683 / 1400
Agentes y herramientas422 / 447 / 1300
Evidencia comparableSolo evidencia adicionalSin evidencia registrada

Recuento propio a partir de los datos públicos. Datos del: . JSON · CSV

Tres situaciones en las que una diferencia engaña

SWE-bench: un modelo en el agente de un proveedor y otro en un entorno de evaluación uniforme representan, en principio, dos sistemas. Nuestra comparación estricta de Verified usa el protocolo Vals definido. En Pro, los resultados declarados de sistemas permanecen separados del protocolo directamente comparable.

HLE: el conjunto completo y el subconjunto de texto tienen denominadores distintos. Las herramientas también cambian los métodos de resolución permitidos. Una diferencia en puntos porcentuales entre estas configuraciones no aislaría la mejora del modelo.

SWE-rebench: cambiar la ventana de tareas cambia los problemas que deben resolverse. Una ventana antigua documentada puede formar su propia cohorte de comparación. Su puesto pertenece a esa ventana y no debe equipararse al de la actual.

Una comparación defendible en tres pasos

Selecciona entre dos y cuatro modelos y un ámbito relevante. Limita la vista a benchmarks medidos para todos ellos. Después revisa las etiquetas de comparabilidad y los detalles antes de interpretar las diferencias frente al modelo de referencia. Una diferencia técnicamente válida tampoco es una prueba de significación estadística.

Nuestra conclusión: un resultado adicional de proveedor aporta información sin crear automáticamente otro puesto justo. Hacer visible esta distinción es más útil que forzar todos los resultados en una única clasificación.

03

Más razonamiento no garantiza un mejor resultado

A menudo se equipara más cálculo con un mejor resultado. Buscamos ejemplos documentados donde un nivel fijo superior de razonamiento obtiene menos puntos con la misma configuración de evaluación declarada.

Un contraejemplo cuestiona una mejora garantizada. No significa que razonar menos sea mejor en general.

Ejemplos de este estado de los datos

Comparamos niveles fijos documentados del mismo modelo, fuente, versión, conjunto de tareas, métrica, herramientas, orquestación del agente y evaluación. Los tamaños de muestra declarados también deben coincidir. Usamos evidencia actual y reciente del protocolo canónico, sin conflictos ni avisos de contaminación. Excluimos varios resultados ambiguos para un mismo nivel.

Claude Fable 5.1 · CritPt
xhigh31.1 %
max29.7 %

CritPt current leaderboard · Epoch AI mirror · CritPt

Fechas de referencia de la evidencia: 2 de septiembre de 2026 / 2 de septiembre de 2026. No demuestra un efecto causal del razonamiento.

Claude Fable 5 · Vending 2
high5680.26 USD
max4966.64 USD

Vending-Bench 2 current leaderboard · Epoch AI mirror · Vending-Bench 2

Fechas de referencia de la evidencia: 2 de septiembre de 2026 / 2 de septiembre de 2026. No demuestra un efecto causal del razonamiento.

Claude Opus 4.7 · ARC-AGI-1
high93.5 %
max92.0 %

ARC-AGI-1 current leaderboard · Epoch AI mirror · ARC-AGI-1

Fechas de referencia de la evidencia: 2 de septiembre de 2026 / 2 de septiembre de 2026. No demuestra un efecto causal del razonamiento.

Qué permiten afirmar estos ejemplos

Son contraejemplos seleccionados deliberadamente, no una muestra representativa ni una estimación de frecuencia. Las distintas fechas y los ajustes no revelados pueden seguir influyendo. Sin repeticiones y un análisis adecuado de incertidumbre, no puede establecerse la causa de una diferencia.

Por eso la tabla selecciona por defecto el nivel documentado más alto de la serie elegida y no el mejor resultado escogido después entre todos los niveles. Así la regla es rastreable. En tu aplicación, evalúa conjuntamente calidad, latencia y coste; estos resultados de calidad por sí solos no forman una clasificación de eficiencia.

¿Quién gestiona esta página?

LLM Benchmarks es un proyecto gestionado de forma privada por Christopher Böhm. Reúne evaluaciones publicadas de modelos, sus fuentes y limitaciones para compararlas en un mismo lugar.

Una selección rastreable nos importa más que una clasificación aparentemente indiscutible. Toda comparación debe permitir llegar a su evidencia.

Nuestra aportación

Relacionamos identidades de modelos y versiones de benchmarks, separamos condiciones de prueba distintas, señalamos información incierta o contradictoria y ofrecemos funciones de comparación y exportación. Las explicaciones y análisis hacen comprensibles estas decisiones. No presentamos mediciones de terceros como pruebas propias.

Responsabilidad y mantenimiento

Christopher Böhm es el responsable y contacto del proyecto. La recopilación y las comprobaciones técnicas están parcialmente automatizadas. El proyecto mantiene las reglas de publicación, la atribución de fuentes y la evidencia complementaria seleccionada. La automatización puede propagar errores; por eso los enlaces a fuentes, los detalles y el contacto para correcciones forman parte del servicio.

Financiación y reglas de selección

El responsable acepta apoyo voluntario mediante PayPal. El sitio también está preparado para un espacio publicitario manual de AdSense. La inclusión de modelos, la selección de mediciones y los puestos siguen las reglas de datos descritas en la metodología. Citar una fuente documenta el origen de un resultado y no constituye una recomendación de producto.

Contacto y correcciones

¿Has encontrado un resultado incorrecto, una identificación errónea o una limitación ausente? Envía el nombre del modelo, el benchmark, la información afectada y, si es posible, una fuente original. También agradecemos sugerencias sobre pruebas publicadas que falten. No envíes datos confidenciales.