Mediciones respaldadas por fuentes
Guías y metodología
Entiende los benchmarks, compara las mediciones de forma justa y consulta las fuentes de LLM Benchmarks. Metodología, guía de pruebas y análisis basados en datos.
¿De dónde salen las puntuaciones?
Un resultado resulta útil cuando sabemos qué modelo se probó y en qué condiciones. Aquí explicamos cómo seleccionamos, comprobamos y presentamos los resultados publicados en la tabla comparativa.
Nuestra aportación consiste en reunir y comprobar la evidencia. Las evaluaciones originales las realizan los responsables de los benchmarks y los proveedores de modelos enlazados.
1. ¿Qué modelos y fuentes se incluyen?
La selección combina modelos del Epoch Capabilities Index con otras evaluaciones exigentes, lanzamientos recientes de proveedores que hemos verificado y una cuota dedicada a modelos abiertos. Así se incluyen modelos pequeños poco representados en las grandes clasificaciones. Es una muestra del mercado, no un directorio completo.
Utilizamos resultados de los responsables de los benchmarks, evaluaciones independientes e informes documentados de proveedores. La identidad del modelo, la fuente, la versión de la prueba y las condiciones de publicación deben poder rastrearse. Un resultado de acceso público no está automáticamente autorizado para su republicación. Los informes de proveedores conservan su atribución.
2. ¿Cuándo son comparables dos resultados?
El nombre del benchmark no basta. Consideramos la edición, la versión, el conjunto o período de tareas, la métrica, la unidad, las herramientas, la configuración del agente y el procedimiento de evaluación. Cada benchmark tiene un protocolo de comparación definido. Otras configuraciones pueden aportar evidencia útil, pero no reciben implícitamente el mismo estatus en la clasificación.
- Puesto: posición dentro del protocolo admisible del benchmark; no es un veredicto global sobre el modelo.
- ≈: evidencia complementaria obtenida en otras condiciones. Consultar primero los detalles de la medición.
- Conflicto: fuentes fiables discrepan para una misma configuración documentada. No hay un puesto único fiable.
- Celda vacía: no hay una medición visible que corresponda. No significa cero puntos ni una evaluación fallida.
3. ¿Qué nivel de razonamiento se selecciona?
Dentro de la misma fuente y serie de pruebas, preferimos el nivel fijo documentado más alto: max, xhigh, high, medium, low, minimal, off. No escogemos después el resultado que tenga más puntos. Por tanto, una ejecución Max válida puede puntuar menos que High. No mezclamos agentes, versiones o conjuntos de tareas para obtener un nivel superior.
Adaptive indica que el razonamiento está activado, pero no demuestra un presupuesto máximo fijo. Los ajustes no revelados siguen siendo desconocidos. La etiqueta High de dos proveedores no implica necesariamente el mismo presupuesto de cálculo.
4. ¿Qué significan las fechas y categorías de fuentes?
La fecha de evaluación, la publicación, la versión de los datos y la primera observación son hechos distintos. Si una fuente no fecha una ejecución, podemos utilizar la primera vez que se observó ese resultado exacto. Eso no demuestra que la evaluación sea reciente. Los detalles indican en qué se basa la fecha.
La autoridad de la fuente y la calidad de la evidencia se evalúan por separado. A+, A, B y C son nuestras categorías de fuentes y evidencia, no probabilidades estadísticas de que un resultado sea correcto. Una buena categoría de fuente no elimina las diferencias entre condiciones de prueba.
5. Lo que la tabla no permite demostrar
Las diferencias pequeñas no demuestran una ventaja de rendimiento sin un análisis adecuado de incertidumbre. Los puntos porcentuales no son una mejora porcentual relativa. Un índice compuesto mide algo distinto del éxito en una tarea concreta; no promediamos las columnas para crear una puntuación global propia.
Los resultados de cuantización y hardware siguen siendo estudios complementarios. Distintos motores de ejecución, GPU o subconjuntos de tareas impiden aislar el efecto de la cuantización. El tamaño de los archivos de pesos, la capacidad de la GPU y la memoria realmente utilizada son magnitudes distintas. Las pruebas de hardware publicadas no son mediciones de laboratorio realizadas por LLM Benchmarks.
6. Comprobar la evidencia y comunicar errores
Abre una celda para consultar su fuente, configuración, fecha y variantes de razonamiento. Los datos pueden descargarse en CSV y JSON. Para comunicar un error, indica el modelo, el benchmark, el valor afectado y un enlace a la evidencia original. Las fuentes modificadas se comprueban de nuevo según las reglas de publicación; los errores confirmados se corrigen en los datos.
¿Qué mide cada benchmark?
La métrica útil depende de tu tarea. Un índice general, una prueba de conocimientos y una evaluación de agentes de programación miden cosas distintas. Esta guía ayuda a interpretar cada tipo de resultado.
Empieza por la tarea, comprueba el protocolo de evaluación y después compara los resultados.
Capacidad general: ECI e índices compuestos
El Epoch Capabilities Index combina resultados de distintas pruebas en una escala común de capacidades. Ofrece una primera visión de varios ámbitos. Su valor no es el porcentaje de tareas resueltas. Los datos nuevos pueden cambiar las estimaciones incluso de modelos que no han cambiado.
Nuestra interpretación: utiliza un índice para preseleccionar modelos y después revisa las pruebas pertinentes para tu trabajo. Un asistente especializado puede encajar aunque tenga un índice general inferior. No deben restarse puntuaciones de índices distintos.
Conocimientos y razonamiento: GPQA, HLE y matemáticas
GPQA contiene preguntas difíciles de biología, física y química elaboradas por especialistas. La tabla utiliza su subconjunto Diamond. Estas pruebas aportan evidencia sobre la resolución de problemas en las condiciones indicadas. No miden automáticamente la fiabilidad en investigaciones abiertas.
El conjunto HLE completo y su subconjunto de texto permanecen separados. El acceso a herramientas puede cambiar la tarea. En matemáticas importa la dificultad: un buen resultado en un conjunto antiguo o más fácil no demuestra rendimiento en tareas nuevas y difíciles. Para una aplicación de conocimientos también probaríamos tus propias preguntas con fuentes verificables.
Programación: ¿una tarea aislada o un agente completo?
Una evaluación de programación puede probar un problema autónomo o un agente que trabaja en un repositorio existente. SWE-bench evalúa incidencias reales de software. Las herramientas, la orquestación del agente y el entorno de prueba también influyen en el resultado.
Nuestra interpretación: al elegir un agente de programación, compara configuraciones de sistemas documentadas. Para funciones individuales puede ser más pertinente una prueba acotada. Verified, Pro y los conjuntos cambiantes de Rebench no son intercambiables. El éxito en un conjunto no predice el éxito en tu repositorio.
Agentes y herramientas: el proceso forma parte de la prueba
Las evaluaciones de terminal, uso de herramientas y agentes de varios turnos exigen actuar en un entorno definido. Las API disponibles, la configuración del agente y los límites de tiempo y llamadas forman parte del significado del resultado. Por ejemplo, las dos configuraciones Banking permanecen separadas en la tabla.
Nuestra interpretación: estos resultados son especialmente útiles si la prueba se parece a tu proceso. De lo contrario, quedan sin evaluar aspectos esenciales como permisos, recuperación tras errores y criterios propios de éxito. Revisa los detalles y prueba una pequeña selección de situaciones representativas de tu uso.
Interpretar pruebas de instrucciones y preferencias
IFEval evalúa instrucciones objetivamente verificables, como restricciones de salida. Es útil cuando tu proceso depende del cumplimiento de requisitos concretos. No demuestra una exactitud factual general ni la calidad especializada de todas las respuestas.
Las clasificaciones Arena reflejan preferencias según su procedimiento de comparación. Una respuesta preferida no es necesariamente correcta. Nuestra interpretación: las preferencias pueden orientar decisiones sobre estilo de escritura; verificar la exactitud requiere además comprobaciones específicas del ámbito.
Todos los benchmarks de la tabla comparativa
El siguiente directorio enlaza las páginas originales e indica nuestros protocolos de comparación. La versión y las tareas importan más que unos nombres parecidos. La agrupación sirve para orientarse; no pondera una clasificación global.
Resumen
Epoch Capabilities Index
Índice compuesto de capacidades ajustado por Epoch AI a partir de más de 50 benchmarks.
- Fuente de comparación
- Epoch Capabilities Index
- Versión / tareas
- Epoch ECI snapshot 2026-10-01 · official-composite-fit
- Métrica / unidad
- eci · index_points
Artificial Analysis Intelligence Index
Artificial Analysis' composite Intelligence Index; one value per model and reasoning setting. The protocol identifies the methodology version.
- Fuente de comparación
- Artificial Analysis · Intelligence Index evaluations
- Versión / tareas
- Artificial Analysis Intelligence Index v4.3 · intelligence-index-v4-3
- Métrica / unidad
- index_score · points
Arena Text
Clasificación de modelos de texto según preferencias humanas.
- Fuente de comparación
- Arena Text
- Versión / tareas
- 2026-09-30 · overall-style-control
- Métrica / unidad
- arena_score · points
LiveBench
Evaluación objetiva de capacidades amplias, actualizada con frecuencia.
- Fuente de comparación
- LiveBench
- Versión / tareas
- 2026-06-25 · overall-seven-category
- Métrica / unidad
- category_balanced_average · percent
Conocimiento y razonamiento
Humanity's Last Exam · Full multimodal
Los valores comparables usan el protocolo multimodal completo de 2.500 preguntas sin herramientas; los demás protocolos permanecen separados.
- Fuente de comparación
- Scale AI Labs · Humanity's Last Exam Full
- Versión / tareas
- HLE finalized 2,500 · Scale protocol 2025-04-03 · full-multimodal-2500-no-tools
- Métrica / unidad
- accuracy · percent
Humanity's Last Exam · Text-only
Subconjunto de solo texto de Artificial Analysis: 2.158 de las 2.500 preguntas, sin herramientas. Un conjunto de preguntas distinto, no una medición más débil del protocolo completo.
- Fuente de comparación
- Artificial Analysis · Intelligence Index evaluations
- Versión / tareas
- HLE text-only (Artificial Analysis) · text-only-2158-no-tools
- Métrica / unidad
- accuracy · percent
SimpleQA Verified
Conocimiento factual de respuesta corta y calidad de la abstención.
- Fuente de comparación
- Epoch AI SimpleQA Verified
- Versión / tareas
- Epoch independent Inspect runs · verified-1000-epoch-inspect
- Métrica / unidad
- accuracy · percent
GPQA Diamond
Preguntas científicas de nivel universitario avanzado sobre física, química y biología.
- Fuente de comparación
- Vals AI GPQA Diamond
- Versión / tareas
- GPQA Diamond v1 · Vals dual-prompt · diamond-198-zero-and-five-shot-cot
- Métrica / unidad
- accuracy · percent
MMLU-Pro
Broad academic multiple-choice knowledge and reasoning across fourteen subjects; Vals AI's independent run over the MMLU-Pro set.
- Fuente de comparación
- Vals AI · MMLU-Pro
- Versión / tareas
- Vals MMLU-Pro v1 · vals-mmlu-pro-overall
- Métrica / unidad
- accuracy · percent
FrontierMath T1–3
Evaluaciones independientes de Epoch AI sobre 295 problemas de matemáticas avanzadas; el nivel 4 permanece separado.
- Fuente de comparación
- Epoch AI · FrontierMath Tiers 1–3 v2
- Versión / tareas
- 2.0.0 · private-285-of-295-problem-tiers-1-3-set
- Métrica / unidad
- mean_score · percent
ARC-AGI-2
Inducción de reglas abstractas en 360 tareas, con variantes pass@2 separadas por esfuerzo.
- Fuente de comparación
- ARC-AGI-2
- Versión / tareas
- v2 · semi-private-120
- Métrica / unidad
- accuracy · percent
FrontierMath T4
Independent Epoch AI runs on the 41 private research-level problems from the 43-problem FrontierMath Tier 4 v2 set; the two public examples and Tiers 1–3 are not mixed into this column.
- Fuente de comparación
- Epoch AI · FrontierMath Tier 4 v2
- Versión / tareas
- 2.0.0 · private-41-of-43-problem-tier-4-set
- Métrica / unidad
- mean_score · percent
MMMU-Pro
Conocimiento experto y razonamiento multimodal.
- Fuente de comparación
- Vals AI · MMMU-Pro
- Versión / tareas
- Vals MMMU-Pro v1 · vals-mmmu-pro-overall
- Métrica / unidad
- accuracy · percent
CritPt
Research-level physics reasoning across 71 open-ended challenges graded automatically.
- Fuente de comparación
- Artificial Analysis · Intelligence Index evaluations
- Versión / tareas
- CritPt (Artificial Analysis) · 70-challenges-official-grading
- Métrica / unidad
- accuracy · percent
SimpleBench
Trick-question common-sense reasoning where humans still beat frontier models; average of five runs.
- Fuente de comparación
- Epoch AI mirror · SimpleBench
- Versión / tareas
- SimpleBench current leaderboard · official-set-avg-at-5
- Métrica / unidad
- accuracy_avg_at_5 · percent
Chess Puzzles
Epoch AI's 100 engine-generated chess puzzles with one best move each, run and dated by Epoch.
- Fuente de comparación
- Epoch AI · Chess Puzzles
- Versión / tareas
- Epoch AI Chess Puzzles v1 · 100-engine-generated-single-best-move-puzzles
- Métrica / unidad
- mean_score · percent
ARC-AGI-1
Original ARC-AGI abstraction puzzles on the semi-private set as reported by ARC Prize.
- Fuente de comparación
- Epoch AI mirror · ARC-AGI-1
- Versión / tareas
- ARC-AGI-1 current leaderboard · semi-private-evaluation-pass-at-2
- Métrica / unidad
- pass_at_2_accuracy · percent
IFEval
Instruction following. Provider reports and subset studies retain their scoring and sample-set labels; they do not form a uniform cross-model ranking.
Resultados complementarios; no se especifica un protocolo canónico común.
Página original del benchmark ↗IFBench
Cumplimiento preciso de instrucciones: 300 prompts con 344 restricciones verificables, precisión estricta por instrucción según el Swallow LLM Leaderboard.
- Fuente de comparación
- Swallow LLM Leaderboard
- Versión / tareas
- swallow-evaluation-instruct · ifbench-test-300-prompts-344-instructions
- Métrica / unidad
- inst_level_strict_acc · percent
Código
SWE-bench Verified
Tasa de resolución de 500 problemas reales de software verificados; la comparación principal usa un agente mínimo uniforme.
- Fuente de comparación
- Vals AI SWE-bench Verified
- Versión / tareas
- SWE-bench Verified v1 · verified-500-vals-mini-swe-agent
- Métrica / unidad
- resolved_rate · percent
SWE-rebench v2
Resolución reciente de problemas de software dentro de una ventana temporal.
- Fuente de comparación
- SWE-rebench
- Versión / tareas
- rolling-v2 · 2026-05-15/2026-07-01
- Métrica / unidad
- resolved_rate · percent
SWE-bench-Live · Lite
Resolución de software actualizada continuamente, conservando agente, modelo y esfuerzo declarado.
- Fuente de comparación
- SWE-bench-Live · Lite
- Versión / tareas
- SWE-bench-Live Lite · lite-300-python
- Métrica / unidad
- resolved_rate · percent
DeepSWE
Tareas originales de ingeniería de software de largo alcance, con resultados separados por agente y nivel de razonamiento.
- Fuente de comparación
- DeepSWE official live leaderboard
- Versión / tareas
- DeepSWE v1.1 live leaderboard · 113-original-long-horizon-tasks
- Métrica / unidad
- pass_at_1 · percent
SWE-bench Pro Public · Scale
Scale AI Labs' separate 731-task professional software-engineering benchmark. Results keep the submitted model, agent label, confidence interval and row-specific publication date; they are never mixed with SWE-bench Verified, SWE-rebench or vendor supplemental protocols. A July 2026 OpenAI audit reported substantial task-quality concerns, so SWE-Pro should be read as one imperfect signal rather than an absolute model ranking.
- Fuente de comparación
- Scale AI Labs · SWE-bench Pro Public
- Versión / tareas
- Scale public 731-task leaderboard · public-731
- Métrica / unidad
- resolved_rate · percent
CursorBench
Evaluación de agentes de código con niveles explícitos de razonamiento y metadatos de coste, tokens y pasos.
- Fuente de comparación
- Epoch AI mirror · CursorBench
- Versión / tareas
- CursorBench current leaderboard · official-current-suite
- Métrica / unidad
- score · percent
FrontierCode 1.1 · Main
Tareas de código difíciles centradas en la integración, conservando agente y nivel de razonamiento.
- Fuente de comparación
- Epoch AI mirror · FrontierCode 1.1
- Versión / tareas
- FrontierCode 1.1 · main-100-hardest-tasks
- Métrica / unidad
- mergeability_rubric_mean_at_5 · percent
IOI
IOI 2024 and 2025 olympiad problems evaluated by Vals AI with olympiad graders.
- Fuente de comparación
- Vals AI · IOI
- Versión / tareas
- Vals IOI v2 · vals-ioi-2024-2026-overall
- Métrica / unidad
- score · percent
LiveCodeBench
Competitive programming problems released after training cutoffs; Vals AI's independent implementation, overall pass@1.
- Fuente de comparación
- Vals AI · LiveCodeBench
- Versión / tareas
- Vals LiveCodeBench v1 · vals-livecodebench-overall
- Métrica / unidad
- pass_at_1 · percent
SciCode
Programación científica medida por precisión de subproblemas con pruebas Python ejecutables.
- Fuente de comparación
- Epoch AI mirror · SciCode
- Versión / tareas
- SciCode current leaderboard · scientific-research-coding-subproblems
- Métrica / unidad
- subproblem_accuracy · percent
ALE-Bench
Score-based algorithmic optimisation contests (AtCoder Heuristic); performance rating.
- Fuente de comparación
- Epoch AI mirror · ALE-Bench
- Versión / tareas
- ALE-Bench current leaderboard · atcoder-heuristic-contest-set
- Métrica / unidad
- performance_rating · points
Vibe Code Bench
Building complete web applications from scratch in an agent harness, evaluated by Vals AI.
- Fuente de comparación
- Vals AI · Vibe Code Bench
- Versión / tareas
- Vals Vibe Code Bench v1.1 · vals-vibe-code-bench-overall
- Métrica / unidad
- score · percent
Text Arena · Coding
Preferencias humanas para aplicaciones web generadas con React y TypeScript.
- Fuente de comparación
- Epoch AI mirror · Text Arena (Coding)
- Versión / tareas
- Text Arena Coding current pool · text-arena-coding-bradley-terry
- Métrica / unidad
- bradley_terry_rating · points
WeirdML
Unusual machine-learning tasks solved end-to-end by writing and running code.
- Fuente de comparación
- Epoch AI mirror · WeirdML
- Versión / tareas
- WeirdML v2 current leaderboard · weirdml-v2-task-set
- Métrica / unidad
- accuracy · percent
Agentes y herramientas
Terminal-Bench 2.0
Terminal-Bench 2.0 leaderboard over 89 hard terminal tasks; agent harness and run date stay attached to every score.
- Fuente de comparación
- Epoch AI mirror · Terminal-Bench 2.0
- Versión / tareas
- Terminal-Bench 2.0 · official-89-task-set
- Métrica / unidad
- accuracy_mean · percent
Terminal-Bench 2.1
Vals AI's independent Terminal-Bench 2.1 run with one uniform harness; vendor reports remain supplemental.
- Fuente de comparación
- Vals AI · Terminal-Bench 2.1
- Versión / tareas
- Vals Terminal-Bench 2.1 v2.1 · vals-terminal-bench-2-1-overall
- Métrica / unidad
- accuracy · percent
Terminal-Bench 3.0
Clasificación oficial de agente y modelo en 74 tareas difíciles de terminal; agente, esfuerzo e intentos permanecen ligados a cada puntuación.
- Fuente de comparación
- Terminal-Bench 3.0
- Versión / tareas
- 3.0 · b936386b-4afd-4ad7-aa7f-6b52bcab9853 · official-74-task-leaderboard
- Métrica / unidad
- accuracy · percent
τ³-Banking · Official harness
Tareas bancarias de varios turnos que requieren conocimiento, recuperación, herramientas y un usuario simulado, según la clasificación oficial.
- Fuente de comparación
- τ³-Banking
- Versión / tareas
- 1.0.1 · banking_knowledge
- Métrica / unidad
- pass_1 · percent
τ³-Banking · Artificial Analysis harness
Ejecución propia de Artificial Analysis sobre el mismo dominio: 97 tareas, recuperación BM25/grep y otro usuario simulado. El simulador forma parte de la medición, por eso es una columna aparte y no una segunda opinión.
- Fuente de comparación
- Artificial Analysis · Intelligence Index evaluations
- Versión / tareas
- τ³-Banking (Artificial Analysis) · banking-97-tasks-gpt-5-4-mini-simulator
- Métrica / unidad
- pass_at_1 · percent
MCP-Atlas · Scale
Real-world multi-step tool use across 1,000 tasks, 36 MCP servers and 220 tools. The comparable lane uses Scale's April 2026 rescored protocol, all public and private tasks, a 100-tool-call budget and the exact row-specific publication date.
- Fuente de comparación
- Scale AI Labs · MCP-Atlas
- Versión / tareas
- MCP-Atlas April 2026 rescored protocol · all-1000-public-500-private-500
- Métrica / unidad
- pass_rate · percent
SkillsBench v1.1
Benchmark auditado de agentes en 87 tareas profesionales; los protocolos con y sin habilidades permanecen separados.
- Fuente de comparación
- SkillsBench v1.1
- Versión / tareas
- v1.1 · official-87-tasks-with-skills
- Métrica / unidad
- pass_rate · percent
APEX-Agents
Trabajo profesional de largo alcance en banca, consultoría y derecho con herramientas de oficina y ejecución de código.
- Fuente de comparación
- Epoch AI mirror · APEX-Agents
- Versión / tareas
- APEX-Agents current leaderboard · 480-professional-tasks-33-worlds
- Métrica / unidad
- pass_at_1 · percent
Berkeley Function Calling Leaderboard V4
Llamadas a funciones, uso de herramientas en varios turnos y resistencia a alucinaciones en BFCL V4.
- Fuente de comparación
- BFCL V4
- Versión / tareas
- v4-ede5081a24bc · overall
- Métrica / unidad
- overall_accuracy · percent
LMArena Agent Arena
Human preference evaluation of agent outcomes. Every score retains the submitted model, disclosed thinking label, confidence interval and observation count.
- Fuente de comparación
- LMArena Agent Arena
- Versión / tareas
- 2026-09-30 · overall-ips-aggregate
- Métrica / unidad
- ips_score · ips
AppWorld
Interactive coding-agent benchmark across controllable applications and APIs; model, method, scaffold and task/scenario metrics remain attached to each run.
- Fuente de comparación
- AppWorld official leaderboard
- Versión / tareas
- official-c1f56015cf7c · test-challenge-all
- Métrica / unidad
- task_goal_completion · percent
Vending-Bench 2
Long-horizon business simulation: mean final balance in USD after a simulated year.
- Fuente de comparación
- Epoch AI mirror · Vending-Bench 2
- Versión / tareas
- Vending-Bench 2 current leaderboard · one-simulated-year-mean-final-balance
- Métrica / unidad
- mean_final_balance_usd · USD
GDPval-AA v2.1
Successor of GDPval-AA v2: the same 220 tasks and judges, Elo refitted and pinned to DeepSeek V4.1 Flash (max) at 1600 - not comparable with v2 values.
- Fuente de comparación
- Artificial Analysis · Intelligence Index evaluations
- Versión / tareas
- GDPval-AA v2.1 (Crowd-BT Elo, DeepSeek V4.1 Flash (max) at 1600) · 220-tasks-elo-v2-1
- Métrica / unidad
- elo · points
¿Qué nos dicen realmente los datos?
No nos limitamos a mirar qué modelo obtiene más puntos. Estos análisis muestran dónde la evidencia sostiene una comparación, dónde faltan mediciones y qué conclusiones serían excesivas.
Los indicadores se calculan con el mismo estado de los datos que la tabla. La interpretación es de LLM Benchmarks; las mediciones proceden de las fuentes citadas.
Cómo utilizar estos análisis
La selección de modelos y la disponibilidad de pruebas publicadas condicionan cada análisis. Más evidencia significa más información verificable, no automáticamente un modelo mejor. Cada informe indica su unidad de recuento, fecha de los datos y limitaciones. Los informes se recalculan con el conjunto publicado y no son repeticiones independientes de las pruebas.
Leer comparaciones concretas y casos prácticos →
01Modelos abiertos pequeños: ¿qué evidencia respalda la comparación?
Elegir un modelo abierto pequeño exige más que un buen resultado aislado. Para los modelos seleccionados con menos de 36.000 millones de parámetros totales, examinamos cuántos pares modelo-benchmark tienen evidencia y dónde es directamente comparable.
Una cobertura amplia facilita la preselección. Mide la evidencia disponible, no la calidad del modelo ni sus necesidades de memoria.
¿Cuánta evidencia hay disponible?
Un par combina un modelo y un benchmark de la tabla completa. Varios niveles de razonamiento cuentan una sola vez; los estudios de cuantización no cuentan como evidencia del modelo base. «Comparable» exige al menos un resultado sin conflictos con ese estatus en la tabla. Se consideran todas las configuraciones base registradas, no solo la vista filtrada actual.
Cada barra abarca todos los pares posibles de su ámbito. Cifras: comparables / documentados / posibles.
Recuento propio a partir de los datos públicos. Datos del: . JSON · CSV
¿Qué implica para elegir un modelo?
Busca primero evidencia en tu ámbito. Muchas mediciones de conocimientos no cubren una carencia en agentes de programación. Compara después los benchmarks comunes a tus candidatos y revisa sus protocolos. Los parámetros totales desconocidos no se deducen de los nombres y no permiten entrar en este análisis de menos de 36B.
Las partes claras del gráfico son lagunas de información en nuestros datos. Un modelo puede haberse evaluado en otro lugar sin que dispongamos de un registro publicable. La selección de modelos también está organizada. Por tanto, las barras no demuestran una ventaja general de modelos abiertos o cerrados.
Reproducir el análisis
En el JSON, selecciona modelos abiertos con un total documentado de parámetros mayor que cero y menor que 36.000 millones. Incluye solo benchmarks del sitio. Deduplica la evidencia base por modelo y benchmark y separa las variantes cuantizadas. El conjunto incluye resultados antiguos que siguen siendo publicables. Comprueba además las fechas individuales antes de decidir qué utilizar.
02Mismo benchmark, condiciones distintas
Dos resultados publicados pueden ser correctos sin permitir calcular una diferencia justa. Contamos cuántos pares modelo-benchmark tienen evidencia comparable y explicamos la distinción mediante nuestros protocolos de evaluación.
Medido en común no significa automáticamente directamente comparable. La versión, las tareas y la configuración deben coincidir antes de calcular diferencias.
Documentado no siempre significa comparable
El análisis cuenta pares entre todos los modelos seleccionados y los benchmarks del sitio. Un par está documentado cuando existe al menos un resultado base. Para ser comparable necesita además un resultado sin conflictos con el estatus correspondiente en la tabla. El resto solo contiene evidencia complementaria o no directamente comparable. Las variantes de razonamiento no se cuentan varias veces.
Cada barra abarca todos los pares posibles de su ámbito. Cifras: comparables / documentados / posibles.
Recuento propio a partir de los datos públicos. Datos del: . JSON · CSV
Tres situaciones en las que una diferencia engaña
SWE-bench: un modelo en el agente de un proveedor y otro en un entorno de evaluación uniforme representan, en principio, dos sistemas. Nuestra comparación estricta de Verified usa el protocolo Vals definido. En Pro, los resultados declarados de sistemas permanecen separados del protocolo directamente comparable.
HLE: el conjunto completo y el subconjunto de texto tienen denominadores distintos. Las herramientas también cambian los métodos de resolución permitidos. Una diferencia en puntos porcentuales entre estas configuraciones no aislaría la mejora del modelo.
SWE-rebench: cambiar la ventana de tareas cambia los problemas que deben resolverse. Una ventana antigua documentada puede formar su propia cohorte de comparación. Su puesto pertenece a esa ventana y no debe equipararse al de la actual.
Una comparación defendible en tres pasos
Selecciona entre dos y cuatro modelos y un ámbito relevante. Limita la vista a benchmarks medidos para todos ellos. Después revisa las etiquetas de comparabilidad y los detalles antes de interpretar las diferencias frente al modelo de referencia. Una diferencia técnicamente válida tampoco es una prueba de significación estadística.
Nuestra conclusión: un resultado adicional de proveedor aporta información sin crear automáticamente otro puesto justo. Hacer visible esta distinción es más útil que forzar todos los resultados en una única clasificación.
03Más razonamiento no garantiza un mejor resultado
A menudo se equipara más cálculo con un mejor resultado. Buscamos ejemplos documentados donde un nivel fijo superior de razonamiento obtiene menos puntos con la misma configuración de evaluación declarada.
Un contraejemplo cuestiona una mejora garantizada. No significa que razonar menos sea mejor en general.
Ejemplos de este estado de los datos
Comparamos niveles fijos documentados del mismo modelo, fuente, versión, conjunto de tareas, métrica, herramientas, orquestación del agente y evaluación. Los tamaños de muestra declarados también deben coincidir. Usamos evidencia actual y reciente del protocolo canónico, sin conflictos ni avisos de contaminación. Excluimos varios resultados ambiguos para un mismo nivel.
Claude Fable 5.1 · CritPt
CritPt current leaderboard · Epoch AI mirror · CritPt
Fechas de referencia de la evidencia: 2 de septiembre de 2026 / 2 de septiembre de 2026. No demuestra un efecto causal del razonamiento.
Claude Fable 5 · Vending 2
Vending-Bench 2 current leaderboard · Epoch AI mirror · Vending-Bench 2
Fechas de referencia de la evidencia: 2 de septiembre de 2026 / 2 de septiembre de 2026. No demuestra un efecto causal del razonamiento.
Claude Opus 4.7 · ARC-AGI-1
ARC-AGI-1 current leaderboard · Epoch AI mirror · ARC-AGI-1
Fechas de referencia de la evidencia: 2 de septiembre de 2026 / 2 de septiembre de 2026. No demuestra un efecto causal del razonamiento.
Qué permiten afirmar estos ejemplos
Son contraejemplos seleccionados deliberadamente, no una muestra representativa ni una estimación de frecuencia. Las distintas fechas y los ajustes no revelados pueden seguir influyendo. Sin repeticiones y un análisis adecuado de incertidumbre, no puede establecerse la causa de una diferencia.
Por eso la tabla selecciona por defecto el nivel documentado más alto de la serie elegida y no el mejor resultado escogido después entre todos los niveles. Así la regla es rastreable. En tu aplicación, evalúa conjuntamente calidad, latencia y coste; estos resultados de calidad por sí solos no forman una clasificación de eficiencia.
¿Quién gestiona esta página?
LLM Benchmarks es un proyecto gestionado de forma privada por Christopher Böhm. Reúne evaluaciones publicadas de modelos, sus fuentes y limitaciones para compararlas en un mismo lugar.
Una selección rastreable nos importa más que una clasificación aparentemente indiscutible. Toda comparación debe permitir llegar a su evidencia.
Nuestra aportación
Relacionamos identidades de modelos y versiones de benchmarks, separamos condiciones de prueba distintas, señalamos información incierta o contradictoria y ofrecemos funciones de comparación y exportación. Las explicaciones y análisis hacen comprensibles estas decisiones. No presentamos mediciones de terceros como pruebas propias.
Responsabilidad y mantenimiento
Christopher Böhm es el responsable y contacto del proyecto. La recopilación y las comprobaciones técnicas están parcialmente automatizadas. El proyecto mantiene las reglas de publicación, la atribución de fuentes y la evidencia complementaria seleccionada. La automatización puede propagar errores; por eso los enlaces a fuentes, los detalles y el contacto para correcciones forman parte del servicio.
Financiación y reglas de selección
El responsable acepta apoyo voluntario mediante PayPal. El sitio también está preparado para un espacio publicitario manual de AdSense. La inclusión de modelos, la selección de mediciones y los puestos siguen las reglas de datos descritas en la metodología. Citar una fuente documenta el origen de un resultado y no constituye una recomendación de producto.
Contacto y correcciones
¿Has encontrado un resultado incorrecto, una identificación errónea o una limitación ausente? Envía el nombre del modelo, el benchmark, la información afectada y, si es posible, una fuente original. También agradecemos sugerencias sobre pruebas publicadas que falten. No envíes datos confidenciales.