LLM Benchmarks
Mediciones respaldadas por fuentes
Compara 100 modelos de IA en capacidad general, conocimiento, programación y agentes, con fuentes, fechas y reglas de comparación claras.
| Resumen | Conocimiento y razonamiento | Código | Agentes y herramientas | |||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Rango ECI ↓ · Modelo | ECI, Resumen, Epoch Capabilities Index: 82/100 modelos medidos; 82 comparables. Protocolo canónico: Epoch ECI snapshot 2026-10-01 · official-composite-fit · Epoch Capabilities Index. Mejores comparables primero.Info | AA Index, Resumen, Artificial Analysis Intelligence Index: 58/100 modelos medidos; 58 comparables, 1 puestos compartidos. Protocolo canónico: Artificial Analysis Intelligence Index v4.3 · intelligence-index-v4-3 · Artificial Analysis · Intelligence Index evaluations. Ordenar.Info | Arena, Resumen, Arena Text: 80/100 modelos medidos; 80 comparables, 23 puestos compartidos. Protocolo canónico: 2026-09-30 · overall-style-control · Arena Text. Ordenar.Info | LiveBench, Resumen, LiveBench: 55/100 modelos medidos; 55 comparables. Protocolo canónico: 2026-06-25 · overall-seven-category · LiveBench. Ordenar.Info | HLE Full, Conocimiento y razonamiento, Humanity's Last Exam · Full multimodal: 54/100 modelos medidos; 16 comparables, 38 con protocolo distinto, 1 puestos compartidos. Protocolo canónico: HLE finalized 2,500 · Scale protocol 2025-04-03 · full-multimodal-2500-no-tools · Scale AI Labs · Humanity's Last Exam Full. Ordenar.Info | GPQA, Conocimiento y razonamiento, GPQA Diamond: 89/100 modelos medidos; 56 comparables, 33 con protocolo distinto, 27 puestos compartidos. Protocolo canónico: GPQA Diamond v1 · Vals dual-prompt · diamond-198-zero-and-five-shot-cot · Vals AI GPQA Diamond. Ordenar.Info | MMLU-Pro, Conocimiento y razonamiento, MMLU-Pro: 66/100 modelos medidos; 57 comparables, 9 con protocolo distinto, 14 puestos compartidos. Protocolo canónico: Vals MMLU-Pro v1 · vals-mmlu-pro-overall · Vals AI · MMLU-Pro. Ordenar.Info | FrontierMath T1–3, Conocimiento y razonamiento, FrontierMath T1–3: 64/100 modelos medidos; 64 comparables, 16 puestos compartidos. Protocolo canónico: 2.0.0 · private-285-of-295-problem-tiers-1-3-set · Epoch AI · FrontierMath Tiers 1–3 v2. Ordenar.Info | SWE-bench, Código, SWE-bench Verified: 60/100 modelos medidos; 60 comparables, 18 puestos compartidos. Protocolo canónico: SWE-bench Verified v1 · verified-500-vals-mini-swe-agent · Vals AI SWE-bench Verified. Muestra solo la evaluación uniforme de Vals AI de 500 tareas con mini-swe-agent y Bash. Es la vista directamente comparable predeterminada. Ordenar.Info | SWE-rebench, Código, SWE-rebench v2: 38/100 modelos medidos; 13 comparables, 8 comparables directamente con aviso de contaminación, 25 con protocolo distinto. Protocolo canónico: rolling-v2 · 2026-05-15/2026-07-01 · SWE-rebench. Muestra la ventana compartida de tareas SWE-rebench más reciente. Las advertencias de contaminación permanecen visibles. 2026-05-15/2026-07-01 Ordenar.Info | LiveCodeBench, Código, LiveCodeBench: 63/100 modelos medidos; 55 comparables, 8 con protocolo distinto, 8 puestos compartidos. Protocolo canónico: Vals LiveCodeBench v1 · vals-livecodebench-overall · Vals AI · LiveCodeBench. Ordenar.Info | SciCode, Código, SciCode: 79/100 modelos medidos; 70 comparables, 9 con protocolo distinto, 8 puestos compartidos. Protocolo canónico: SciCode current leaderboard · scientific-research-coding-subproblems · Epoch AI mirror · SciCode. Ordenar.Info | Terminal 2.1, Agentes y herramientas, Terminal-Bench 2.1: 67/100 modelos medidos; 58 comparables, 9 con protocolo distinto, 12 puestos compartidos. Protocolo canónico: Vals Terminal-Bench 2.1 v2.1 · vals-terminal-bench-2-1-overall · Vals AI · Terminal-Bench 2.1. Ordenar.Info | MCP-Atlas, Agentes y herramientas, MCP-Atlas · Scale: 24/100 modelos medidos; 23 comparables, 1 con protocolo distinto, 2 puestos compartidos. Protocolo canónico: MCP-Atlas April 2026 rescored protocol · all-1000-public-500-private-500 · Scale AI Labs · MCP-Atlas. Ordenar.Info | APEX, Agentes y herramientas, APEX-Agents: 53/100 modelos medidos; 53 comparables, 3 puestos compartidos. Protocolo canónico: APEX-Agents current leaderboard · 480-professional-tasks-33-worlds · Epoch AI mirror · APEX-Agents. Ordenar.Info | GDPval-AA v2.1, Agentes y herramientas, GDPval-AA v2.1: 76/100 modelos medidos; 76 comparables, 2 puestos compartidos. Protocolo canónico: GDPval-AA v2.1 (Crowd-BT Elo, DeepSeek V4.1 Flash (max) at 1600) · 220-tasks-elo-v2-1 · Artificial Analysis · Intelligence Index evaluations. Ordenar.Info |
| Rango 1Claude Opus 5.510/16 medidos · 9 comparables | ||||||||||||||||
| Rango 2GPT 6 astra11/16 medidos · 10 comparables | ||||||||||||||||
| Rango 3Claude Sonnet 5.59/16 medidos · 8 comparables | ||||||||||||||||
| Rango 4Claude Fable 5.113/16 medidos · 12 comparables | ||||||||||||||||
| Rango 5Claude Opus 516/16 medidos · 15 comparables | ||||||||||||||||
| Rango 6GPT 5.5 Pro3/16 medidos · 2 comparables | ||||||||||||||||
| Rango 7Claude Fable 515/16 medidos · 15 comparables | ||||||||||||||||
| Rango 8GPT 5.6 Sol15/16 medidos · 15 comparables | ||||||||||||||||
| Rango 9GPT 5.6 Terra13/16 medidos · 13 comparables | ||||||||||||||||
| Rango 10GPT 5.515/16 medidos · 13 comparables | ||||||||||||||||
| Rango 11GPT 5.4 Pro4/16 medidos · 3 comparables | ||||||||||||||||
| Rango 12Claude Opus 4.815/16 medidos · 13 comparables | ||||||||||||||||
| Rango 13Kimi K315/16 medidos · 14 comparables | ||||||||||||||||
| Rango 14Gemini 3.7 Flash13/16 medidos · 13 comparables | ||||||||||||||||
| Rango 15Gemini 3.8 Flash14/16 medidos · 14 comparables | ||||||||||||||||
| Rango 16GPT 5.414/16 medidos · 13 comparables | ||||||||||||||||
| Rango 17Muse Spark 1 310/16 medidos · 9 comparables | ||||||||||||||||
| Rango 18GPT 5.3 Codex7/16 medidos · 5 comparables | ||||||||||||||||
| Rango 19Grok 4.613/16 medidos · 13 comparables | ||||||||||||||||
| Rango 20Qwen 3.8 Max12/16 medidos · 12 comparables | ||||||||||||||||
| Rango 21GPT 5.6 Luna12/16 medidos · 12 comparables | ||||||||||||||||
| Rango 22Claude Opus 4.715/16 medidos · 14 comparables | ||||||||||||||||
| Rango 23Claude Sonnet 515/16 medidos · 14 comparables | ||||||||||||||||
| Rango 24GLM 5.314/16 medidos · 13 comparables | ||||||||||||||||
| Rango 25GPT 5.2 Pro2/16 medidos · 2 comparables | ||||||||||||||||
| Rango 26DeepSeek V4 Pro (2026-08-13)14/16 medidos · 13 comparables | ||||||||||||||||
| Rango 27Claude Opus 4.612/16 medidos · 11 comparables | ||||||||||||||||
| Rango 28Qwen 3.8 Max (0902)6/16 medidos · 5 comparables | ||||||||||||||||
| Rango 29DeepSeek V4.1 Flash8/16 medidos · 7 comparables | ||||||||||||||||
| Rango 30Muse Spark 1.211/16 medidos · 10 comparables | ||||||||||||||||
| Rango 31Gemini 3.1 Pro16/16 medidos · 15 comparables | ||||||||||||||||
| Rango 32DeepSeek V4 Flash (0731)12/16 medidos · 11 comparables | ||||||||||||||||
| Rango 33Gemini 3.5 Flash16/16 medidos · 14 comparables | ||||||||||||||||
| Rango 34Gemini 3.6 Flash13/16 medidos · 13 comparables | ||||||||||||||||
| Rango 35Muse Spark 1.113/16 medidos · 12 comparables | ||||||||||||||||
| Rango 36Grok 4.514/16 medidos · 14 comparables | ||||||||||||||||
| Rango 37Qwen 3.7 Max11/16 medidos · 11 comparables | ||||||||||||||||
| Rango 38GPT 5.211/16 medidos · 10 comparables | ||||||||||||||||
| Rango 39Gemini 3 Pro10/16 medidos · 9 comparables | ||||||||||||||||
| Rango 40Claude Sonnet 4.615/16 medidos · 13 comparables | ||||||||||||||||
| Rango 41Muse Spark9/16 medidos · 9 comparables | ||||||||||||||||
| Rango 42Grok 4.208/16 medidos · 8 comparables | ||||||||||||||||
| Rango 43GLM 5.3 Flash14/16 medidos · 13 comparables | ||||||||||||||||
| Rango 44Gemini 3 Flash11/16 medidos · 9 comparables | ||||||||||||||||
| Rango 45GLM 5.216/16 medidos · 15 comparables | ||||||||||||||||
| Rango 46Kimi K2.614/16 medidos · 12 comparables | ||||||||||||||||
| Rango 47GPT 5 Pro3/16 medidos · 3 comparables | ||||||||||||||||
| Rango 48Inkling Small13/16 medidos · 12 comparables | ||||||||||||||||
| Rango 49Claude Opus 4.511/16 medidos · 10 comparables | ||||||||||||||||
| Rango 50Kimi K2.7 Code11/16 medidos · 10 comparables | ||||||||||||||||
| Rango 51GPT 511/16 medidos · 10 comparables | ||||||||||||||||
| Rango 52GLM 5.114/16 medidos · 12 comparables | ||||||||||||||||
| Rango 53GPT 5.110/16 medidos · 10 comparables | ||||||||||||||||
| Rango 54Qwen 3.8 27B12/16 medidos · 11 comparables | ||||||||||||||||
| Rango 55Qwen 3.6 Max Preview4/16 medidos · 3 comparables | ||||||||||||||||
| Rango 56Grok 4.313/16 medidos · 12 comparables | ||||||||||||||||
| Rango 57DeepSeek V4 Pro (2026-04-22)14/16 medidos · 13 comparables | ||||||||||||||||
| Rango 58GPT 5.4 Mini12/16 medidos · 12 comparables | ||||||||||||||||
| Rango 59Inkling15/16 medidos · 14 comparables | ||||||||||||||||
| Rango 60Kimi K2.512/16 medidos · 11 comparables | ||||||||||||||||
| Rango 61Qwen 3.6 Plus11/16 medidos · 11 comparables | ||||||||||||||||
| Rango 62Qwen 3.7 Plus9/16 medidos · 7 comparables | ||||||||||||||||
| Rango 63MiniMax M314/16 medidos · 13 comparables | ||||||||||||||||
| Rango 64Claude Sonnet 4.512/16 medidos · 11 comparables | ||||||||||||||||
| Rango 65Qwen 3.5 397B-A17B12/16 medidos · 6 comparables | ||||||||||||||||
| Rango 66Qwen 3.6 27B13/16 medidos · 8 comparables | ||||||||||||||||
| Rango 67DeepSeek V4 Flash (2026-04-22)9/16 medidos · 5 comparables | ||||||||||||||||
| Rango 68GLM 59/16 medidos · 7 comparables | ||||||||||||||||
| Rango 69GPT 5.4 Nano12/16 medidos · 12 comparables | ||||||||||||||||
| Rango 70Gemini 2.5 Pro9/16 medidos · 7 comparables | ||||||||||||||||
| Rango 71Gemini 3.5 Flash Lite12/16 medidos · 12 comparables | ||||||||||||||||
| Rango 72Gemini 3.1 Flash Lite13/16 medidos · 13 comparables | ||||||||||||||||
| Rango 73Claude Opus 4.17/16 medidos · 6 comparables | ||||||||||||||||
| Rango 74Qwen 3.6 35B-A3B11/16 medidos · 6 comparables | ||||||||||||||||
| Rango 75Gemma 4 31B IT6/16 medidos · 2 comparables | ||||||||||||||||
| Rango 76Qwen 3.5 35B-A3B11/16 medidos · 6 comparables | ||||||||||||||||
| Rango 77GPT 5.5 Instant5/16 medidos · 4 comparables | ||||||||||||||||
| Rango 78mistral Medium 3.59/16 medidos · 8 comparables | ||||||||||||||||
| Rango 79Qwen 3.5 9B8/16 medidos · 4 comparables | ||||||||||||||||
| Rango 80Qwen 3 32B5/16 medidos · 4 comparables | ||||||||||||||||
| Rango 81Qwen 3 14B4/16 medidos · 3 comparables | ||||||||||||||||
| Rango 82GPT 4.52/16 medidos · 2 comparables | ||||||||||||||||
| 18 modelos sin puntuación ECI directamente comparable | ||||||||||||||||
| Sin rangoGemini 4 argon4/16 medidos · 3 comparables | ||||||||||||||||
| Sin rangoGPT 6 Sol9/16 medidos · 8 comparables | ||||||||||||||||
| Sin rangoGrok 4.76/16 medidos · 6 comparables | ||||||||||||||||
| Sin rangoGPT 6 Luna9/16 medidos · 8 comparables | ||||||||||||||||
| Sin rangoMiMo V2.6 Pro5/16 medidos · 4 comparables | ||||||||||||||||
| Sin rangoGLM 5.3 Max1/16 medidos · 1 comparables | ||||||||||||||||
| Sin rangoGPT 5.2 Chat Latest (2026-02-10)1/16 medidos · 1 comparables | ||||||||||||||||
| Sin rangoMiMo V2.5 Pro11/16 medidos · 10 comparables | ||||||||||||||||
| Sin rangoHY37/16 medidos · 3 comparables | ||||||||||||||||
| Sin rangoGrok 4.12/16 medidos · 2 comparables | ||||||||||||||||
| Sin rangoQwen 3.5 27B6/16 medidos · 1 comparables | ||||||||||||||||
| Sin rangoQwen 3.8 Flash Next7/16 medidos · 3 comparables | ||||||||||||||||
| Sin rangoGemma 4 12B IT4/16 medidos · 0 comparables | ||||||||||||||||
| Sin rangoGemma 4 26B-A4B IT4/16 medidos · 0 comparables | ||||||||||||||||
| Sin rangoQwen 3.8 2.4T-A95B6/16 medidos · 3 comparables | ||||||||||||||||
| Sin rangoMiMo V2.6 Flash5/16 medidos · 4 comparables | ||||||||||||||||
| Sin rangoGPT 6.1 Sol7/16 medidos · 6 comparables | ||||||||||||||||
| Sin rangoGemma 4 31B7/16 medidos · 3 comparables | ||||||||||||||||