LLM Benchmarks

قياسات موثقة بالمصادر

قارن 100 نموذج ذكاء اصطناعي في القدرات العامة والمعرفة والبرمجة والوكلاء، مع المصادر وتواريخ الاختبارات وقواعد مقارنة واضحة.

آخر تحديث للصفحة
AR
♡ دعم
الاختبارات
النماذج
عوامل التصفية
النماذج
عرض الخلايا
جودة البيانات
مقارنة النماذج
النماذج المتاحة: 100
100 من 100 نموذجًا · 16 اختبارًا
قراءة الجدول
ابحث عن نموذج · اضغط عنوان العمود للترتيب · اضغط النتيجة لعرض مصدرها الخط: أخضر للأحدث · أزرق للحديث · مغرة بعد 3 أشهر≡ مرتبة مشتركة: الفارق أصغر من مهمة واحدة محلولة#3/13 مرتبة النافذة: صالحة فقط داخل نافذة المهام نفسهاDate وصف التاريخ = أساس التاريخS·A+ موثوقية المصدر: A+ الأعلى · A قوية · B موثوقة · C محدودةT·Max أعلى مستوى تفكير مقاس16 16 معيارًا: أربعة لكل مجال. اختر فئة لعرض جميع اختباراتها.يشمل الترتيب والألوان جميع النماذج القابلة للترتيب لكل اختبار، حتى المخفية. تُستخدم خمس درجات من عشر نتائج فأكثر، وتبقى المجموعات الأصغر محايدة. هذه ترتيبات مشتقة وليست قياسات مصدرية.ORG منظم الاختبار · PROV مزود النموذج · 3P مقارنة رسمية بين المزودين تختلف المصادر الموثوقة للبرتوكول المعلن نفسه قابل للمقارنة مباشرة ضمن البروتوكول نفسه، مع احتمال تلوث الاختبار بروتوكول مختلفأهداف الجودة المقاسةالخلايا القابلة للمقارنة: 90% · الهدف ≥85%القيم الأساسية الحديثة: 86% · الهدف ≥90%الأعمدة الأساسية التي تضم ≥60 نموذجًا: 6/16
مشاركة وتصدير

نعرض أعلى مستوى تفكير موثق لكل إعداد اختبار. وقد لا يحقق أعلى نتيجة. المستويات لا تعني ميزانيات حوسبة متساوية بين المزوّدين.

آخر تحديث تم التحقق منه النماذج +0/−0 · القياسات +52 · محدثة 0 · −52 · تم تغيير 0 خلية ظاهرةفتح موجز التغييرات القابل للقراءة آليًا
عرض الخلايا
أفضل 10٪أفضل 25٪الوسطالربع الأدنىالأدنىالترتيب والألوان لجميع النماذج في كل اختبار. مرشحات النماذج تخفي الصفوف فقط.أعلى مستوى تفكير مقاس
نتائج حديثة وموثقة بالمصادر لـ 100 نموذجًا لغويًا. يمكن ترتيب الأعمدة. تُرتب القيم القابلة للمقارنة، ويمكن لـ SWE-Pro أيضًا ترتيب نتائج النظام الرسمية المعلّمة بوضوح مع إبقاء علامة ≈ عند اختلاف البروتوكول.
نظرة عامةالمعرفة والاستدلالالبرمجةالوكلاء والأدوات
ترتيب ⁨ECI⁩ ↓ · النموذجECI, نظرة عامة, Epoch Capabilities Index: 82/100 نماذج مقاسة; 82 قابل للمقارنة. البروتوكول المعتمد: Epoch ECI snapshot 2026-10-01 · official-composite-fit · Epoch Capabilities Index. أفضل القيم القابلة للمقارنة أولًا.شرحAA Index, نظرة عامة, Artificial Analysis Intelligence Index: 58/100 نماذج مقاسة; 58 قابل للمقارنة, 1 مرتبة مشتركة. البروتوكول المعتمد: Artificial Analysis Intelligence Index v4.3 · intelligence-index-v4-3 · Artificial Analysis · Intelligence Index evaluations. ترتيب.شرحArena, نظرة عامة, Arena Text: 80/100 نماذج مقاسة; 80 قابل للمقارنة, 23 مرتبة مشتركة. البروتوكول المعتمد: 2026-09-30 · overall-style-control · Arena Text. ترتيب.شرحLiveBench, نظرة عامة, LiveBench: 55/100 نماذج مقاسة; 55 قابل للمقارنة. البروتوكول المعتمد: 2026-06-25 · overall-seven-category · LiveBench. ترتيب.شرحHLE Full, المعرفة والاستدلال, Humanity's Last Exam · Full multimodal: 54/100 نماذج مقاسة; 16 قابل للمقارنة, 38 ببروتوكول مختلف, 1 مرتبة مشتركة. البروتوكول المعتمد: HLE finalized 2,500 · Scale protocol 2025-04-03 · full-multimodal-2500-no-tools · Scale AI Labs · Humanity's Last Exam Full. ترتيب.شرحGPQA, المعرفة والاستدلال, GPQA Diamond: 89/100 نماذج مقاسة; 56 قابل للمقارنة, 33 ببروتوكول مختلف, 27 مرتبة مشتركة. البروتوكول المعتمد: GPQA Diamond v1 · Vals dual-prompt · diamond-198-zero-and-five-shot-cot · Vals AI GPQA Diamond. ترتيب.شرحMMLU-Pro, المعرفة والاستدلال, MMLU-Pro: 66/100 نماذج مقاسة; 57 قابل للمقارنة, 9 ببروتوكول مختلف, 14 مرتبة مشتركة. البروتوكول المعتمد: Vals MMLU-Pro v1 · vals-mmlu-pro-overall · Vals AI · MMLU-Pro. ترتيب.شرحFrontierMath T1–3, المعرفة والاستدلال, FrontierMath T1–3: 64/100 نماذج مقاسة; 64 قابل للمقارنة, 16 مرتبة مشتركة. البروتوكول المعتمد: 2.0.0 · private-285-of-295-problem-tiers-1-3-set · Epoch AI · FrontierMath Tiers 1–3 v2. ترتيب.شرحSWE-bench, البرمجة, SWE-bench Verified: 60/100 نماذج مقاسة; 60 قابل للمقارنة, 18 مرتبة مشتركة. البروتوكول المعتمد: SWE-bench Verified v1 · verified-500-vals-mini-swe-agent · Vals AI SWE-bench Verified. يعرض فقط تقييم Vals AI الموحّد على 500 مهمة باستخدام mini-swe-agent وBash. وهو العرض الافتراضي القابل للمقارنة مباشرة. ترتيب.شرحSWE-rebench, البرمجة, SWE-rebench v2: 38/100 نماذج مقاسة; 13 قابل للمقارنة, 8 قابل للمقارنة مباشرة مع تحذير من التلوث, 25 ببروتوكول مختلف. البروتوكول المعتمد: rolling-v2 · 2026-05-15/2026-07-01 · SWE-rebench. يعرض أحدث نافذة مهام مشتركة في SWE-rebench. تبقى تحذيرات التلوث ظاهرة. 2026-05-15/2026-07-01 ترتيب.شرحLiveCodeBench, البرمجة, LiveCodeBench: 63/100 نماذج مقاسة; 55 قابل للمقارنة, 8 ببروتوكول مختلف, 8 مرتبة مشتركة. البروتوكول المعتمد: Vals LiveCodeBench v1 · vals-livecodebench-overall · Vals AI · LiveCodeBench. ترتيب.شرحSciCode, البرمجة, SciCode: 79/100 نماذج مقاسة; 70 قابل للمقارنة, 9 ببروتوكول مختلف, 8 مرتبة مشتركة. البروتوكول المعتمد: SciCode current leaderboard · scientific-research-coding-subproblems · Epoch AI mirror · SciCode. ترتيب.شرحTerminal 2.1, الوكلاء والأدوات, Terminal-Bench 2.1: 67/100 نماذج مقاسة; 58 قابل للمقارنة, 9 ببروتوكول مختلف, 12 مرتبة مشتركة. البروتوكول المعتمد: Vals Terminal-Bench 2.1 v2.1 · vals-terminal-bench-2-1-overall · Vals AI · Terminal-Bench 2.1. ترتيب.شرحMCP-Atlas, الوكلاء والأدوات, MCP-Atlas · Scale: 24/100 نماذج مقاسة; 23 قابل للمقارنة, 1 ببروتوكول مختلف, 2 مرتبة مشتركة. البروتوكول المعتمد: MCP-Atlas April 2026 rescored protocol · all-1000-public-500-private-500 · Scale AI Labs · MCP-Atlas. ترتيب.شرحAPEX, الوكلاء والأدوات, APEX-Agents: 53/100 نماذج مقاسة; 53 قابل للمقارنة, 3 مرتبة مشتركة. البروتوكول المعتمد: APEX-Agents current leaderboard · 480-professional-tasks-33-worlds · Epoch AI mirror · APEX-Agents. ترتيب.شرحGDPval-AA v2.1, الوكلاء والأدوات, GDPval-AA v2.1: 76/100 نماذج مقاسة; 76 قابل للمقارنة, 2 مرتبة مشتركة. البروتوكول المعتمد: GDPval-AA v2.1 (Crowd-BT Elo, DeepSeek V4.1 Flash (max) at 1600) · 220-tasks-elo-v2-1 · Artificial Analysis · Intelligence Index evaluations. ترتيب.شرح
الترتيب 1Claude Opus 5.5Anthropic10/16 مقاس · 9 قابل للمقارنة
الترتيب 2GPT 6 astraOpenAI11/16 مقاس · 10 قابل للمقارنة
الترتيب 3Claude Sonnet 5.5Anthropic9/16 مقاس · 8 قابل للمقارنة
الترتيب 4Claude Fable 5.1Anthropic13/16 مقاس · 12 قابل للمقارنة
الترتيب 5Claude Opus 5Anthropic16/16 مقاس · 15 قابل للمقارنة
الترتيب 6GPT 5.5 ProOpenAI3/16 مقاس · 2 قابل للمقارنة
الترتيب 7Claude Fable 5Anthropic15/16 مقاس · 15 قابل للمقارنة
الترتيب 8GPT 5.6 SolOpenAI15/16 مقاس · 15 قابل للمقارنة
الترتيب 9GPT 5.6 TerraOpenAI13/16 مقاس · 13 قابل للمقارنة
الترتيب 10GPT 5.5OpenAI15/16 مقاس · 13 قابل للمقارنة
الترتيب 11GPT 5.4 ProOpenAI4/16 مقاس · 3 قابل للمقارنة
الترتيب 12Claude Opus 4.8Anthropic15/16 مقاس · 13 قابل للمقارنة
الترتيب 13Kimi K3Moonshot AI15/16 مقاس · 14 قابل للمقارنة
الترتيب 14Gemini 3.7 FlashGoogle13/16 مقاس · 13 قابل للمقارنة
الترتيب 15Gemini 3.8 FlashGoogle14/16 مقاس · 14 قابل للمقارنة
الترتيب 16GPT 5.4OpenAI14/16 مقاس · 13 قابل للمقارنة
الترتيب 17Muse Spark 1 3Meta10/16 مقاس · 9 قابل للمقارنة
الترتيب 18GPT 5.3 CodexOpenAI7/16 مقاس · 5 قابل للمقارنة
الترتيب 19Grok 4.6xAI13/16 مقاس · 13 قابل للمقارنة
الترتيب 20Qwen 3.8 MaxAlibaba12/16 مقاس · 12 قابل للمقارنة
الترتيب 21GPT 5.6 LunaOpenAI12/16 مقاس · 12 قابل للمقارنة
الترتيب 22Claude Opus 4.7Anthropic15/16 مقاس · 14 قابل للمقارنة
الترتيب 23Claude Sonnet 5Anthropic15/16 مقاس · 14 قابل للمقارنة
الترتيب 24GLM 5.3Z.ai14/16 مقاس · 13 قابل للمقارنة
الترتيب 25GPT 5.2 ProOpenAI2/16 مقاس · 2 قابل للمقارنة
الترتيب 26DeepSeek V4 Pro (2026-08-13)DeepSeek14/16 مقاس · 13 قابل للمقارنة
الترتيب 27Claude Opus 4.6Anthropic12/16 مقاس · 11 قابل للمقارنة
الترتيب 28Qwen 3.8 Max (0902)Alibaba6/16 مقاس · 5 قابل للمقارنة
الترتيب 29DeepSeek V4.1 FlashDeepSeek8/16 مقاس · 7 قابل للمقارنة
الترتيب 30Muse Spark 1.2Meta11/16 مقاس · 10 قابل للمقارنة
الترتيب 31Gemini 3.1 ProGoogle16/16 مقاس · 15 قابل للمقارنة
الترتيب 32DeepSeek V4 Flash (0731)DeepSeek12/16 مقاس · 11 قابل للمقارنة
الترتيب 33Gemini 3.5 FlashGoogle16/16 مقاس · 14 قابل للمقارنة
الترتيب 34Gemini 3.6 FlashGoogle13/16 مقاس · 13 قابل للمقارنة
الترتيب 35Muse Spark 1.1Meta13/16 مقاس · 12 قابل للمقارنة
الترتيب 36Grok 4.5xAI14/16 مقاس · 14 قابل للمقارنة
الترتيب 37Qwen 3.7 MaxAlibaba11/16 مقاس · 11 قابل للمقارنة
الترتيب 38GPT 5.2OpenAI11/16 مقاس · 10 قابل للمقارنة
الترتيب 39Gemini 3 ProGoogle10/16 مقاس · 9 قابل للمقارنة
الترتيب 40Claude Sonnet 4.6Anthropic15/16 مقاس · 13 قابل للمقارنة
الترتيب 41Muse SparkMeta9/16 مقاس · 9 قابل للمقارنة
الترتيب 42Grok 4.20xAI8/16 مقاس · 8 قابل للمقارنة
الترتيب 43GLM 5.3 FlashZ.ai14/16 مقاس · 13 قابل للمقارنة
الترتيب 44Gemini 3 FlashGoogle11/16 مقاس · 9 قابل للمقارنة
الترتيب 45GLM 5.2Z.ai744B · 40B نشطة16/16 مقاس · 15 قابل للمقارنة
الترتيب 46Kimi K2.6Moonshot AI1T · 32B نشطة14/16 مقاس · 12 قابل للمقارنة
الترتيب 47GPT 5 ProOpenAI3/16 مقاس · 3 قابل للمقارنة
الترتيب 48Inkling SmallThinking Machines Lab276B · 12B نشطة13/16 مقاس · 12 قابل للمقارنة
الترتيب 49Claude Opus 4.5Anthropic11/16 مقاس · 10 قابل للمقارنة
الترتيب 50Kimi K2.7 CodeMoonshot AI1T · 32B نشطة11/16 مقاس · 10 قابل للمقارنة
الترتيب 51GPT 5OpenAI11/16 مقاس · 10 قابل للمقارنة
الترتيب 52GLM 5.1Z.ai744B · 40B نشطة14/16 مقاس · 12 قابل للمقارنة
الترتيب 53GPT 5.1OpenAI10/16 مقاس · 10 قابل للمقارنة
الترتيب 54Qwen 3.8 27BAlibaba27B12/16 مقاس · 11 قابل للمقارنة
الترتيب 55Qwen 3.6 Max PreviewAlibaba4/16 مقاس · 3 قابل للمقارنة
الترتيب 56Grok 4.3xAI13/16 مقاس · 12 قابل للمقارنة
الترتيب 57DeepSeek V4 Pro (2026-04-22)DeepSeek1.6T · 49B نشطة14/16 مقاس · 13 قابل للمقارنة
الترتيب 58GPT 5.4 MiniOpenAI12/16 مقاس · 12 قابل للمقارنة
الترتيب 59InklingThinking Machines Lab975B · 41B نشطة15/16 مقاس · 14 قابل للمقارنة
الترتيب 60Kimi K2.5Moonshot AI1T · 32B نشطة12/16 مقاس · 11 قابل للمقارنة
الترتيب 61Qwen 3.6 PlusAlibaba11/16 مقاس · 11 قابل للمقارنة
الترتيب 62Qwen 3.7 PlusAlibaba9/16 مقاس · 7 قابل للمقارنة
الترتيب 63MiniMax M3MiniMax14/16 مقاس · 13 قابل للمقارنة
الترتيب 64Claude Sonnet 4.5Anthropic12/16 مقاس · 11 قابل للمقارنة
الترتيب 65Qwen 3.5 397B-A17BAlibaba397B · 17B نشطة12/16 مقاس · 6 قابل للمقارنة
الترتيب 66Qwen 3.6 27BAlibaba27B13/16 مقاس · 8 قابل للمقارنة
الترتيب 67DeepSeek V4 Flash (2026-04-22)DeepSeek284B · 13B نشطة9/16 مقاس · 5 قابل للمقارنة
الترتيب 68GLM 5Z.ai9/16 مقاس · 7 قابل للمقارنة
الترتيب 69GPT 5.4 NanoOpenAI12/16 مقاس · 12 قابل للمقارنة
الترتيب 70Gemini 2.5 ProGoogle9/16 مقاس · 7 قابل للمقارنة
الترتيب 71Gemini 3.5 Flash LiteGoogle12/16 مقاس · 12 قابل للمقارنة
الترتيب 72Gemini 3.1 Flash LiteGoogle13/16 مقاس · 13 قابل للمقارنة
الترتيب 73Claude Opus 4.1Anthropic7/16 مقاس · 6 قابل للمقارنة
الترتيب 74Qwen 3.6 35B-A3BAlibaba35B · 3B نشطة11/16 مقاس · 6 قابل للمقارنة
الترتيب 75Gemma 4 31B ITGoogle30.7B6/16 مقاس · 2 قابل للمقارنة
الترتيب 76Qwen 3.5 35B-A3BAlibaba35B · 3B نشطة11/16 مقاس · 6 قابل للمقارنة
الترتيب 77GPT 5.5 InstantOpenAI5/16 مقاس · 4 قابل للمقارنة
الترتيب 78mistral Medium 3.5Mistral AI9/16 مقاس · 8 قابل للمقارنة
الترتيب 79Qwen 3.5 9BAlibaba9B8/16 مقاس · 4 قابل للمقارنة
الترتيب 80Qwen 3 32BAlibaba32.8B5/16 مقاس · 4 قابل للمقارنة
الترتيب 81Qwen 3 14BAlibaba14.8B4/16 مقاس · 3 قابل للمقارنة
الترتيب 82GPT 4.5OpenAI2/16 مقاس · 2 قابل للمقارنة
18 نماذج بلا نتيجة ECI قابلة للمقارنة مباشرة
بلا ترتيبGemini 4 argonGoogle4/16 مقاس · 3 قابل للمقارنة
بلا ترتيبGPT 6 SolOpenAI9/16 مقاس · 8 قابل للمقارنة
بلا ترتيبGrok 4.7xAI6/16 مقاس · 6 قابل للمقارنة
بلا ترتيبGPT 6 LunaOpenAI9/16 مقاس · 8 قابل للمقارنة
بلا ترتيبMiMo V2.6 ProXiaomi5/16 مقاس · 4 قابل للمقارنة
بلا ترتيبGLM 5.3 MaxZ.ai1/16 مقاس · 1 قابل للمقارنة
بلا ترتيبGPT 5.2 Chat Latest (2026-02-10)OpenAI1/16 مقاس · 1 قابل للمقارنة
بلا ترتيبMiMo V2.5 ProXiaomi11/16 مقاس · 10 قابل للمقارنة
بلا ترتيبHY3Tencent7/16 مقاس · 3 قابل للمقارنة
بلا ترتيبGrok 4.1xAI2/16 مقاس · 2 قابل للمقارنة
بلا ترتيبQwen 3.5 27BAlibaba27B6/16 مقاس · 1 قابل للمقارنة
بلا ترتيبQwen 3.8 Flash NextAlibaba125B · 6B نشطة7/16 مقاس · 3 قابل للمقارنة
بلا ترتيبGemma 4 12B ITGoogle12B4/16 مقاس · 0 قابل للمقارنة
بلا ترتيبGemma 4 26B-A4B ITGoogle25.2B · 3.8B نشطة4/16 مقاس · 0 قابل للمقارنة
بلا ترتيبQwen 3.8 2.4T-A95BAlibaba2.4T · 95B نشطة6/16 مقاس · 3 قابل للمقارنة
بلا ترتيبMiMo V2.6 FlashXiaomi5/16 مقاس · 4 قابل للمقارنة
بلا ترتيبGPT 6.1 SolOpenAI7/16 مقاس · 6 قابل للمقارنة
بلا ترتيبGemma 4 31BGoogle7/16 مقاس · 3 قابل للمقارنة