LLM Benchmarks

Mediciones respaldadas por fuentes

Compara 100 modelos de IA en capacidad general, conocimiento, programación y agentes, con fuentes, fechas y reglas de comparación claras.

Benchmarks
Modelos
Filtros
Modelos
Vista de celdas
Calidad de datos
Comparar modelos
Modelos disponibles: 100
100 de 100 modelos · 16 benchmarks
Leer la tabla
Busca un modelo · Pulsa una cabecera para ordenar · Un resultado para ver su fuente Línea: verde muy reciente · azul actual · ocre desde 3 meses≡ Puesto compartido: la ventaja es menor que una sola tarea resuelta#3/13 Puesto de ventana: válido solo dentro de su propia ventana de tareasDate Etiqueta de fecha = fundamentoS·A+ Autoridad de la fuente: A+ máxima · A alta · B sólida · C limitadaT·Max Mayor razonamiento medido16 16 benchmarks: cuatro por área. Elige una categoría para ver todas sus pruebas.Rangos y colores consideran todos los modelos clasificables por benchmark, incluidos los ocultos. Hay cinco bandas desde diez resultados; los grupos menores quedan neutrales. Son rangos derivados, no mediciones de la fuente.ORG Organizador del benchmark · PROV Proveedor del modelo · 3P Comparación oficial externa fuentes fiables discrepan para el mismo protocolo declarado comparable directamente con el mismo protocolo, con posible contaminación del benchmark protocolo distintoObjetivos de calidad medidosCeldas comparables: 90% · objetivo ≥85%Valores esenciales recientes: 86% · objetivo ≥90%Columnas esenciales con ≥60 modelos: 6/16
Compartir y exportar

Para cada configuración mostramos el nivel de razonamiento documentado más alto. No siempre logra la mayor puntuación. Los niveles no equivalen al mismo presupuesto de cómputo entre proveedores.

Última actualización verificada Modelos +0/−0 · Mediciones +52 · actualizadas 0 · −52 · 0 celdas visibles modificadasAbrir el feed de cambios legible por máquina
Vista de celdas
10 % superior25 % superiorZona mediaCuarto inferiorÚltimosRangos y colores abarcan todos los modelos por benchmark. Los filtros solo ocultan filas.Mayor razonamiento medido
Resultados actuales y con fuente de 100 modelos de lenguaje. Las columnas se pueden ordenar. Los valores comparables reciben un rango; SWE-Pro también puede ordenar resultados oficiales del sistema claramente identificados y marca con ≈ los protocolos distintos.
ResumenConocimiento y razonamientoCódigoAgentes y herramientas
Rango ⁨ECI⁩ ↓ · ModeloECI, Resumen, Epoch Capabilities Index: 82/100 modelos medidos; 82 comparables. Protocolo canónico: Epoch ECI snapshot 2026-10-01 · official-composite-fit · Epoch Capabilities Index. Mejores comparables primero.InfoAA Index, Resumen, Artificial Analysis Intelligence Index: 58/100 modelos medidos; 58 comparables, 1 puestos compartidos. Protocolo canónico: Artificial Analysis Intelligence Index v4.3 · intelligence-index-v4-3 · Artificial Analysis · Intelligence Index evaluations. Ordenar.InfoArena, Resumen, Arena Text: 80/100 modelos medidos; 80 comparables, 23 puestos compartidos. Protocolo canónico: 2026-09-30 · overall-style-control · Arena Text. Ordenar.InfoLiveBench, Resumen, LiveBench: 55/100 modelos medidos; 55 comparables. Protocolo canónico: 2026-06-25 · overall-seven-category · LiveBench. Ordenar.InfoHLE Full, Conocimiento y razonamiento, Humanity's Last Exam · Full multimodal: 54/100 modelos medidos; 16 comparables, 38 con protocolo distinto, 1 puestos compartidos. Protocolo canónico: HLE finalized 2,500 · Scale protocol 2025-04-03 · full-multimodal-2500-no-tools · Scale AI Labs · Humanity's Last Exam Full. Ordenar.InfoGPQA, Conocimiento y razonamiento, GPQA Diamond: 89/100 modelos medidos; 56 comparables, 33 con protocolo distinto, 27 puestos compartidos. Protocolo canónico: GPQA Diamond v1 · Vals dual-prompt · diamond-198-zero-and-five-shot-cot · Vals AI GPQA Diamond. Ordenar.InfoMMLU-Pro, Conocimiento y razonamiento, MMLU-Pro: 66/100 modelos medidos; 57 comparables, 9 con protocolo distinto, 14 puestos compartidos. Protocolo canónico: Vals MMLU-Pro v1 · vals-mmlu-pro-overall · Vals AI · MMLU-Pro. Ordenar.InfoFrontierMath T1–3, Conocimiento y razonamiento, FrontierMath T1–3: 64/100 modelos medidos; 64 comparables, 16 puestos compartidos. Protocolo canónico: 2.0.0 · private-285-of-295-problem-tiers-1-3-set · Epoch AI · FrontierMath Tiers 1–3 v2. Ordenar.InfoSWE-bench, Código, SWE-bench Verified: 60/100 modelos medidos; 60 comparables, 18 puestos compartidos. Protocolo canónico: SWE-bench Verified v1 · verified-500-vals-mini-swe-agent · Vals AI SWE-bench Verified. Muestra solo la evaluación uniforme de Vals AI de 500 tareas con mini-swe-agent y Bash. Es la vista directamente comparable predeterminada. Ordenar.InfoSWE-rebench, Código, SWE-rebench v2: 38/100 modelos medidos; 13 comparables, 8 comparables directamente con aviso de contaminación, 25 con protocolo distinto. Protocolo canónico: rolling-v2 · 2026-05-15/2026-07-01 · SWE-rebench. Muestra la ventana compartida de tareas SWE-rebench más reciente. Las advertencias de contaminación permanecen visibles. 2026-05-15/2026-07-01 Ordenar.InfoLiveCodeBench, Código, LiveCodeBench: 63/100 modelos medidos; 55 comparables, 8 con protocolo distinto, 8 puestos compartidos. Protocolo canónico: Vals LiveCodeBench v1 · vals-livecodebench-overall · Vals AI · LiveCodeBench. Ordenar.InfoSciCode, Código, SciCode: 79/100 modelos medidos; 70 comparables, 9 con protocolo distinto, 8 puestos compartidos. Protocolo canónico: SciCode current leaderboard · scientific-research-coding-subproblems · Epoch AI mirror · SciCode. Ordenar.InfoTerminal 2.1, Agentes y herramientas, Terminal-Bench 2.1: 67/100 modelos medidos; 58 comparables, 9 con protocolo distinto, 12 puestos compartidos. Protocolo canónico: Vals Terminal-Bench 2.1 v2.1 · vals-terminal-bench-2-1-overall · Vals AI · Terminal-Bench 2.1. Ordenar.InfoMCP-Atlas, Agentes y herramientas, MCP-Atlas · Scale: 24/100 modelos medidos; 23 comparables, 1 con protocolo distinto, 2 puestos compartidos. Protocolo canónico: MCP-Atlas April 2026 rescored protocol · all-1000-public-500-private-500 · Scale AI Labs · MCP-Atlas. Ordenar.InfoAPEX, Agentes y herramientas, APEX-Agents: 53/100 modelos medidos; 53 comparables, 3 puestos compartidos. Protocolo canónico: APEX-Agents current leaderboard · 480-professional-tasks-33-worlds · Epoch AI mirror · APEX-Agents. Ordenar.InfoGDPval-AA v2.1, Agentes y herramientas, GDPval-AA v2.1: 76/100 modelos medidos; 76 comparables, 2 puestos compartidos. Protocolo canónico: GDPval-AA v2.1 (Crowd-BT Elo, DeepSeek V4.1 Flash (max) at 1600) · 220-tasks-elo-v2-1 · Artificial Analysis · Intelligence Index evaluations. Ordenar.Info
Rango 1Claude Opus 5.5Anthropic10/16 medidos · 9 comparables
Rango 2GPT 6 astraOpenAI11/16 medidos · 10 comparables
Rango 3Claude Sonnet 5.5Anthropic9/16 medidos · 8 comparables
Rango 4Claude Fable 5.1Anthropic13/16 medidos · 12 comparables
Rango 5Claude Opus 5Anthropic16/16 medidos · 15 comparables
Rango 6GPT 5.5 ProOpenAI3/16 medidos · 2 comparables
Rango 7Claude Fable 5Anthropic15/16 medidos · 15 comparables
Rango 8GPT 5.6 SolOpenAI15/16 medidos · 15 comparables
Rango 9GPT 5.6 TerraOpenAI13/16 medidos · 13 comparables
Rango 10GPT 5.5OpenAI15/16 medidos · 13 comparables
Rango 11GPT 5.4 ProOpenAI4/16 medidos · 3 comparables
Rango 12Claude Opus 4.8Anthropic15/16 medidos · 13 comparables
Rango 13Kimi K3Moonshot AI15/16 medidos · 14 comparables
Rango 14Gemini 3.7 FlashGoogle13/16 medidos · 13 comparables
Rango 15Gemini 3.8 FlashGoogle14/16 medidos · 14 comparables
Rango 16GPT 5.4OpenAI14/16 medidos · 13 comparables
Rango 17Muse Spark 1 3Meta10/16 medidos · 9 comparables
Rango 18GPT 5.3 CodexOpenAI7/16 medidos · 5 comparables
Rango 19Grok 4.6xAI13/16 medidos · 13 comparables
Rango 20Qwen 3.8 MaxAlibaba12/16 medidos · 12 comparables
Rango 21GPT 5.6 LunaOpenAI12/16 medidos · 12 comparables
Rango 22Claude Opus 4.7Anthropic15/16 medidos · 14 comparables
Rango 23Claude Sonnet 5Anthropic15/16 medidos · 14 comparables
Rango 24GLM 5.3Z.ai14/16 medidos · 13 comparables
Rango 25GPT 5.2 ProOpenAI2/16 medidos · 2 comparables
Rango 26DeepSeek V4 Pro (2026-08-13)DeepSeek14/16 medidos · 13 comparables
Rango 27Claude Opus 4.6Anthropic12/16 medidos · 11 comparables
Rango 28Qwen 3.8 Max (0902)Alibaba6/16 medidos · 5 comparables
Rango 29DeepSeek V4.1 FlashDeepSeek8/16 medidos · 7 comparables
Rango 30Muse Spark 1.2Meta11/16 medidos · 10 comparables
Rango 31Gemini 3.1 ProGoogle16/16 medidos · 15 comparables
Rango 32DeepSeek V4 Flash (0731)DeepSeek12/16 medidos · 11 comparables
Rango 33Gemini 3.5 FlashGoogle16/16 medidos · 14 comparables
Rango 34Gemini 3.6 FlashGoogle13/16 medidos · 13 comparables
Rango 35Muse Spark 1.1Meta13/16 medidos · 12 comparables
Rango 36Grok 4.5xAI14/16 medidos · 14 comparables
Rango 37Qwen 3.7 MaxAlibaba11/16 medidos · 11 comparables
Rango 38GPT 5.2OpenAI11/16 medidos · 10 comparables
Rango 39Gemini 3 ProGoogle10/16 medidos · 9 comparables
Rango 40Claude Sonnet 4.6Anthropic15/16 medidos · 13 comparables
Rango 41Muse SparkMeta9/16 medidos · 9 comparables
Rango 42Grok 4.20xAI8/16 medidos · 8 comparables
Rango 43GLM 5.3 FlashZ.ai14/16 medidos · 13 comparables
Rango 44Gemini 3 FlashGoogle11/16 medidos · 9 comparables
Rango 45GLM 5.2Z.ai744B · 40B activos16/16 medidos · 15 comparables
Rango 46Kimi K2.6Moonshot AI1T · 32B activos14/16 medidos · 12 comparables
Rango 47GPT 5 ProOpenAI3/16 medidos · 3 comparables
Rango 48Inkling SmallThinking Machines Lab276B · 12B activos13/16 medidos · 12 comparables
Rango 49Claude Opus 4.5Anthropic11/16 medidos · 10 comparables
Rango 50Kimi K2.7 CodeMoonshot AI1T · 32B activos11/16 medidos · 10 comparables
Rango 51GPT 5OpenAI11/16 medidos · 10 comparables
Rango 52GLM 5.1Z.ai744B · 40B activos14/16 medidos · 12 comparables
Rango 53GPT 5.1OpenAI10/16 medidos · 10 comparables
Rango 54Qwen 3.8 27BAlibaba27B12/16 medidos · 11 comparables
Rango 55Qwen 3.6 Max PreviewAlibaba4/16 medidos · 3 comparables
Rango 56Grok 4.3xAI13/16 medidos · 12 comparables
Rango 57DeepSeek V4 Pro (2026-04-22)DeepSeek1,6T · 49B activos14/16 medidos · 13 comparables
Rango 58GPT 5.4 MiniOpenAI12/16 medidos · 12 comparables
Rango 59InklingThinking Machines Lab975B · 41B activos15/16 medidos · 14 comparables
Rango 60Kimi K2.5Moonshot AI1T · 32B activos12/16 medidos · 11 comparables
Rango 61Qwen 3.6 PlusAlibaba11/16 medidos · 11 comparables
Rango 62Qwen 3.7 PlusAlibaba9/16 medidos · 7 comparables
Rango 63MiniMax M3MiniMax14/16 medidos · 13 comparables
Rango 64Claude Sonnet 4.5Anthropic12/16 medidos · 11 comparables
Rango 65Qwen 3.5 397B-A17BAlibaba397B · 17B activos12/16 medidos · 6 comparables
Rango 66Qwen 3.6 27BAlibaba27B13/16 medidos · 8 comparables
Rango 67DeepSeek V4 Flash (2026-04-22)DeepSeek284B · 13B activos9/16 medidos · 5 comparables
Rango 68GLM 5Z.ai9/16 medidos · 7 comparables
Rango 69GPT 5.4 NanoOpenAI12/16 medidos · 12 comparables
Rango 70Gemini 2.5 ProGoogle9/16 medidos · 7 comparables
Rango 71Gemini 3.5 Flash LiteGoogle12/16 medidos · 12 comparables
Rango 72Gemini 3.1 Flash LiteGoogle13/16 medidos · 13 comparables
Rango 73Claude Opus 4.1Anthropic7/16 medidos · 6 comparables
Rango 74Qwen 3.6 35B-A3BAlibaba35B · 3B activos11/16 medidos · 6 comparables
Rango 75Gemma 4 31B ITGoogle30,7B6/16 medidos · 2 comparables
Rango 76Qwen 3.5 35B-A3BAlibaba35B · 3B activos11/16 medidos · 6 comparables
Rango 77GPT 5.5 InstantOpenAI5/16 medidos · 4 comparables
Rango 78mistral Medium 3.5Mistral AI9/16 medidos · 8 comparables
Rango 79Qwen 3.5 9BAlibaba9B8/16 medidos · 4 comparables
Rango 80Qwen 3 32BAlibaba32,8B5/16 medidos · 4 comparables
Rango 81Qwen 3 14BAlibaba14,8B4/16 medidos · 3 comparables
Rango 82GPT 4.5OpenAI2/16 medidos · 2 comparables
18 modelos sin puntuación ECI directamente comparable
Sin rangoGemini 4 argonGoogle4/16 medidos · 3 comparables
Sin rangoGPT 6 SolOpenAI9/16 medidos · 8 comparables
Sin rangoGrok 4.7xAI6/16 medidos · 6 comparables
Sin rangoGPT 6 LunaOpenAI9/16 medidos · 8 comparables
Sin rangoMiMo V2.6 ProXiaomi5/16 medidos · 4 comparables
Sin rangoGLM 5.3 MaxZ.ai1/16 medidos · 1 comparables
Sin rangoGPT 5.2 Chat Latest (2026-02-10)OpenAI1/16 medidos · 1 comparables
Sin rangoMiMo V2.5 ProXiaomi11/16 medidos · 10 comparables
Sin rangoHY3Tencent7/16 medidos · 3 comparables
Sin rangoGrok 4.1xAI2/16 medidos · 2 comparables
Sin rangoQwen 3.5 27BAlibaba27B6/16 medidos · 1 comparables
Sin rangoQwen 3.8 Flash NextAlibaba125B · 6B activos7/16 medidos · 3 comparables
Sin rangoGemma 4 12B ITGoogle12B4/16 medidos · 0 comparables
Sin rangoGemma 4 26B-A4B ITGoogle25,2B · 3,8B activos4/16 medidos · 0 comparables
Sin rangoQwen 3.8 2.4T-A95BAlibaba2,4T · 95B activos6/16 medidos · 3 comparables
Sin rangoMiMo V2.6 FlashXiaomi5/16 medidos · 4 comparables
Sin rangoGPT 6.1 SolOpenAI7/16 medidos · 6 comparables
Sin rangoGemma 4 31BGoogle7/16 medidos · 3 comparables