LLM Benchmarks

قياسات موثقة بالمصادر

آخر تحديث للصفحة
AR
♡ دعم

الأدلة والمنهجية

افهم الاختبارات وقارن القياسات بإنصاف واستكشف مصادر LLM Benchmarks. منهجية العمل ودليل الاختبارات وتحليلات تستند إلى البيانات.

من أين تأتي النتائج؟

تصبح النتيجة مفيدة عندما نعرف النموذج الذي خضع للاختبار والظروف التي اختُبر فيها. نوضح هنا كيف نختار النتائج المنشورة ونتحقق منها ونعرضها في جدول المقارنة.

تتمثل مساهمتنا في جمع الأدلة والتحقق منها. أما التقييمات الأصلية فتجريها الجهات المسؤولة عن الاختبارات ومزودو النماذج المشار إليهم في الروابط.

١. ما النماذج والمصادر المشمولة؟

يجمع الاختيار بين نماذج Epoch Capabilities Index وتقييمات صعبة أخرى وإصدارات حديثة تحققنا منها لدى المزودين، مع حصة مخصصة للنماذج المفتوحة. ويشمل ذلك نماذج صغيرة لا تحظى بتمثيل واسع في قوائم الترتيب الكبرى. إنها عينة من السوق وليست دليلاً شاملاً لكل النماذج.

نستخدم نتائج الجهات المسؤولة عن الاختبارات والتقييمات المستقلة وتقارير المزودين الموثقة. يجب أن تكون هوية النموذج والمصدر ونسخة الاختبار وشروط النشر قابلة للتتبع. إتاحة نتيجة للعامة لا تعني تلقائياً السماح بإعادة نشرها. وتظل تقارير المزودين منسوبة إلى أصحابها.

٢. متى يمكن مقارنة نتيجتين؟

اسم الاختبار وحده لا يكفي. نراعي الإصدار والنسخة ومجموعة المهام أو فترتها والمقياس والوحدة والأدوات وإعداد الوكيل وإجراء التقييم. لكل اختبار مسار مقارنة محدد. وقد تضيف الإعدادات الأخرى أدلة مفيدة، لكنها لا تحصل ضمنياً على مكانة الترتيب نفسها.

  • الترتيب: موقع النموذج ضمن بروتوكول الاختبار المؤهل للمقارنة، وليس حكماً عاماً على النموذج.
  • ≈: دليل إضافي في ظروف مختلفة. ينبغي مراجعة تفاصيل القياس أولاً.
  • تعارض: اختلاف مصادر موثوقة بشأن الإعداد الموثق نفسه. لا يوجد ترتيب واحد يمكن الاعتماد عليه.
  • خلية فارغة: لا يوجد قياس ظاهر مطابق. ولا يعني ذلك صفراً من النقاط أو فشلاً في الاختبار.

٣. أي مستوى من التفكير نختار؟

ضمن المصدر وسلسلة الاختبارات نفسيهما، نفضل أعلى مستوى ثابت موثق: max ثم xhigh ثم high ثم medium ثم low ثم minimal ثم off. لا نختار لاحقاً النتيجة الأعلى نقاطاً. لذلك قد تكون نتيجة Max الصحيحة أقل من High. ولا نخلط بين الوكلاء أو نسخ الاختبار أو مجموعات المهام للوصول إلى مستوى أعلى.

تعني Adaptive أن التفكير مفعّل، لكنها لا تثبت ميزانية قصوى ثابتة. وتظل الإعدادات غير المعلنة مجهولة. كما أن تسمية High لدى مزودين مختلفين لا تعني بالضرورة ميزانية حسابية متساوية.

٤. ماذا تعني التواريخ ودرجات المصادر؟

تاريخ التقييم والنشر ونسخة البيانات وأول رصد أحداث مختلفة. عندما لا يحدد المصدر تاريخ تشغيل معين، قد نستخدم أول مرة رُصدت فيها تلك النتيجة الدقيقة. وهذا لا يثبت أن التقييم حديث. توضح تفاصيل القياس الأساس الذي استند إليه التاريخ.

نقيّم موثوقية المصدر وجودة الأدلة بشكل منفصل. الفئات A+ وA وB وC هي تصنيفاتنا للمصادر والأدلة، وليست احتمالات إحصائية لصحة النتيجة. ولا تلغي الدرجة العالية للمصدر اختلاف ظروف الاختبار.

٥. ما الذي لا يثبته الجدول؟

لا تثبت الفروق الصغيرة تفوقاً في الأداء دون تحليل مناسب لعدم اليقين. النقاط المئوية ليست نسبة تحسن مئوية نسبية. كما يقيس المؤشر المركب شيئاً مختلفاً عن النجاح في مهمة محددة؛ ولا نحسب متوسط الأعمدة لإنشاء نتيجة إجمالية خاصة بنا.

تظل نتائج التكميم والأجهزة دراسات إضافية. اختلاف محركات التنفيذ أو وحدات GPU أو مجموعات المهام يمنع عزل أثر التكميم وحده. حجم ملفات الأوزان وسعة GPU واستهلاك الذاكرة المقاس مقادير مختلفة. اختبارات الأجهزة المنشورة ليست قياسات مخبرية أجرتها LLM Benchmarks.

٦. فحص الأدلة والإبلاغ عن الأخطاء

افتح قيمة في الجدول للاطلاع على المصدر وإعداد الاختبار والتاريخ ومستويات التفكير المتاحة. يمكن تنزيل البيانات بصيغتي CSV وJSON. عند الإبلاغ عن خطأ، اذكر النموذج والاختبار والقيمة المعنية ورابطاً للدليل الأصلي. تُفحص المصادر المتغيرة مجدداً وفق قواعد النشر، وتُصحح الأخطاء المؤكدة في البيانات.

ماذا يقيس كل اختبار؟

يعتمد المقياس المفيد على مهمتك. فمؤشر القدرات العامة واختبار المعرفة وتقييم وكيل البرمجة تقيس أشياء مختلفة. يساعد هذا الدليل على تفسير كل نوع من النتائج.

ابدأ بالمهمة، ثم افحص بروتوكول التقييم، وبعد ذلك قارن النتائج.

القدرات العامة: ECI والمؤشرات المركبة

يجمع Epoch Capabilities Index نتائج اختبارات مختلفة على مقياس مشترك للقدرات. ويقدم نظرة أولية عبر مجالات متعددة. قيمته ليست نسبة المهام المحلولة. وقد تغير البيانات الجديدة التقديرات حتى لنماذج لم تتغير.

تفسيرنا: استخدم المؤشر لإعداد قائمة مختصرة، ثم افحص الاختبارات المناسبة لعملك. قد يناسبك مساعد متخصص رغم انخفاض مؤشره العام. ولا ينبغي طرح درجات مؤشرات مختلفة بعضها من بعض.

المعرفة والاستدلال: GPQA وHLE والرياضيات

يتضمن GPQA أسئلة صعبة أعدها متخصصون في الأحياء والفيزياء والكيمياء. يعتمد الجدول مجموعة Diamond الفرعية. تقدم هذه الاختبارات أدلة على حل المشكلات ضمن الإعداد المحدد، ولا تقيس تلقائياً الموثوقية في البحث المفتوح.

نبقي مجموعة HLE الكاملة ومجموعتها النصية منفصلتين. وقد يغير الوصول إلى الأدوات طبيعة المهمة. في الرياضيات، تُعد صعوبة المهام أساسية: النجاح في مجموعة أقدم أو أسهل لا يثبت الأداء في مهام جديدة صعبة. ولتطبيق معرفي، نختبر أيضاً أسئلتك الخاصة مع مصادر يمكن التحقق منها.

البرمجة: مهمة منفردة أم وكيل كامل؟

قد يقيّم اختبار البرمجة مسألة مستقلة أو وكيلاً يعمل في مستودع برمجي قائم. يقيّم SWE-bench مشكلات برمجية حقيقية. وتؤثر الأدوات وتنسيق عمل الوكيل وبيئة الاختبار أيضاً في النتيجة.

تفسيرنا: عند اختيار وكيل برمجة، قارن إعدادات أنظمة موثقة. وقد يكون اختبار أضيق أنسب للدوال الفردية. لا يمكن اعتبار Verified وPro ومجموعات Rebench المتغيرة بدائل متكافئة. النجاح في مجموعة لا يتنبأ بالنجاح في مستودعك.

الوكلاء والأدوات: سير العمل جزء من الاختبار

تتطلب اختبارات الطرفية واستخدام الأدوات والوكلاء متعددي الجولات أن يتصرف النموذج داخل بيئة محددة. تدخل واجهات API المتاحة وإعداد الوكيل وحدود الوقت وعدد الاستدعاءات في معنى النتيجة. لهذا نبقي مثلاً إعدادَي Banking منفصلين في الجدول.

تفسيرنا: تفيد هذه النتائج خصوصاً عندما يشبه الاختبار سير عملك. وإلا تبقى جوانب أساسية دون تقييم، مثل الصلاحيات والتعافي من الأخطاء ومعايير نجاحك الخاصة. افحص تفاصيل القياس وجرّب مجموعة صغيرة من حالات الاستخدام الممثلة لعملك.

قراءة تقييمات التعليمات والتفضيلات

يفحص IFEval تعليمات يمكن التحقق منها موضوعياً، مثل قيود المخرجات المطلوبة. يفيد ذلك إذا اعتمد عملك على الالتزام بمتطلبات محددة. لكنه لا يثبت دقة الحقائق بصورة شاملة أو الجودة التخصصية لكل إجابة.

تعكس قوائم Arena تفضيلات وفق إجراء المقارنة المستخدم. وليست الإجابة المفضلة صحيحة بالضرورة. تفسيرنا: قد تساعد أدلة التفضيل على اختيار أسلوب الكتابة، لكن التحقق من الصحة يحتاج أيضاً إلى فحوص متخصصة بالمجال.

جميع اختبارات جدول المقارنة

يربط الدليل التالي بالصفحات الأصلية ويحدد مسارات المقارنة المعتمدة لدينا. معلومات النسخة والمهام أهم من تشابه أسماء الاختبارات. يساعد التصنيف على التصفح، ولا يمثل أوزاناً لترتيب إجمالي.

نظرة عامة

Epoch Capabilities Index

مؤشر قدرات مركّب صممته Epoch AI اعتمادًا على أكثر من 50 اختبارًا.

مصدر المقارنة
Epoch Capabilities Index
النسخة / المهام
Epoch ECI snapshot 2026-10-01 · official-composite-fit
المقياس / الوحدة
eci · index_points
صفحة الاختبار الأصلية ↗
Artificial Analysis Intelligence Index

Artificial Analysis' composite Intelligence Index; one value per model and reasoning setting. The protocol identifies the methodology version.

مصدر المقارنة
Artificial Analysis · Intelligence Index evaluations
النسخة / المهام
Artificial Analysis Intelligence Index v4.3 · intelligence-index-v4-3
المقياس / الوحدة
index_score · points
صفحة الاختبار الأصلية ↗
Arena Text

ترتيب نماذج النص وفق التفضيلات البشرية.

مصدر المقارنة
Arena Text
النسخة / المهام
2026-09-30 · overall-style-control
المقياس / الوحدة
arena_score · points
صفحة الاختبار الأصلية ↗
LiveBench

تقييم موضوعي واسع القدرات يُحدَّث بصورة متكررة.

مصدر المقارنة
LiveBench
النسخة / المهام
2026-06-25 · overall-seven-category
المقياس / الوحدة
category_balanced_average · percent
صفحة الاختبار الأصلية ↗

المعرفة والاستدلال

Humanity's Last Exam · Full multimodal

تستخدم القيم القابلة للمقارنة بروتوكول HLE الكامل متعدد الوسائط المكوّن من 2500 سؤال من دون أدوات؛ وتبقى البروتوكولات الأخرى منفصلة.

مصدر المقارنة
Scale AI Labs · Humanity's Last Exam Full
النسخة / المهام
HLE finalized 2,500 · Scale protocol 2025-04-03 · full-multimodal-2500-no-tools
المقياس / الوحدة
accuracy · percent
صفحة الاختبار الأصلية ↗
Humanity's Last Exam · Text-only

المجموعة النصية من Artificial Analysis: 2158 من أصل 2500 سؤال، من دون أدوات. مجموعة أسئلة مختلفة، وليست قياساً أضعف للبروتوكول الكامل.

مصدر المقارنة
Artificial Analysis · Intelligence Index evaluations
النسخة / المهام
HLE text-only (Artificial Analysis) · text-only-2158-no-tools
المقياس / الوحدة
accuracy · percent
صفحة الاختبار الأصلية ↗
SimpleQA Verified

المعرفة الواقعية في الإجابات القصيرة وجودة الامتناع عن الإجابة.

مصدر المقارنة
Epoch AI SimpleQA Verified
النسخة / المهام
Epoch independent Inspect runs · verified-1000-epoch-inspect
المقياس / الوحدة
accuracy · percent
صفحة الاختبار الأصلية ↗
GPQA Diamond

أسئلة علوم بمستوى الدراسات العليا في الفيزياء والكيمياء والأحياء.

مصدر المقارنة
Vals AI GPQA Diamond
النسخة / المهام
GPQA Diamond v1 · Vals dual-prompt · diamond-198-zero-and-five-shot-cot
المقياس / الوحدة
accuracy · percent
صفحة الاختبار الأصلية ↗
MMLU-Pro

Broad academic multiple-choice knowledge and reasoning across fourteen subjects; Vals AI's independent run over the MMLU-Pro set.

مصدر المقارنة
Vals AI · MMLU-Pro
النسخة / المهام
Vals MMLU-Pro v1 · vals-mmlu-pro-overall
المقياس / الوحدة
accuracy · percent
صفحة الاختبار الأصلية ↗
FrontierMath T1–3

تشغيلات مستقلة من Epoch AI على 295 مسألة رياضيات متقدمة أعدها خبراء؛ ويظل المستوى الرابع منفصلًا.

مصدر المقارنة
Epoch AI · FrontierMath Tiers 1–3 v2
النسخة / المهام
2.0.0 · private-285-of-295-problem-tiers-1-3-set
المقياس / الوحدة
mean_score · percent
صفحة الاختبار الأصلية ↗
ARC-AGI-2

استقراء قواعد مجردة عبر 360 مهمة تقييم مع فصل متغيرات pass@2 حسب جهد الاستدلال.

مصدر المقارنة
ARC-AGI-2
النسخة / المهام
v2 · semi-private-120
المقياس / الوحدة
accuracy · percent
صفحة الاختبار الأصلية ↗
FrontierMath T4

Independent Epoch AI runs on the 41 private research-level problems from the 43-problem FrontierMath Tier 4 v2 set; the two public examples and Tiers 1–3 are not mixed into this column.

مصدر المقارنة
Epoch AI · FrontierMath Tier 4 v2
النسخة / المهام
2.0.0 · private-41-of-43-problem-tier-4-set
المقياس / الوحدة
mean_score · percent
صفحة الاختبار الأصلية ↗
MMMU-Pro

معرفة خبراء واستدلال متعدد الوسائط.

مصدر المقارنة
Vals AI · MMMU-Pro
النسخة / المهام
Vals MMMU-Pro v1 · vals-mmmu-pro-overall
المقياس / الوحدة
accuracy · percent
صفحة الاختبار الأصلية ↗
CritPt

Research-level physics reasoning across 71 open-ended challenges graded automatically.

مصدر المقارنة
Artificial Analysis · Intelligence Index evaluations
النسخة / المهام
CritPt (Artificial Analysis) · 70-challenges-official-grading
المقياس / الوحدة
accuracy · percent
صفحة الاختبار الأصلية ↗
SimpleBench

Trick-question common-sense reasoning where humans still beat frontier models; average of five runs.

مصدر المقارنة
Epoch AI mirror · SimpleBench
النسخة / المهام
SimpleBench current leaderboard · official-set-avg-at-5
المقياس / الوحدة
accuracy_avg_at_5 · percent
صفحة الاختبار الأصلية ↗
Chess Puzzles

Epoch AI's 100 engine-generated chess puzzles with one best move each, run and dated by Epoch.

مصدر المقارنة
Epoch AI · Chess Puzzles
النسخة / المهام
Epoch AI Chess Puzzles v1 · 100-engine-generated-single-best-move-puzzles
المقياس / الوحدة
mean_score · percent
صفحة الاختبار الأصلية ↗
ARC-AGI-1

Original ARC-AGI abstraction puzzles on the semi-private set as reported by ARC Prize.

مصدر المقارنة
Epoch AI mirror · ARC-AGI-1
النسخة / المهام
ARC-AGI-1 current leaderboard · semi-private-evaluation-pass-at-2
المقياس / الوحدة
pass_at_2_accuracy · percent
صفحة الاختبار الأصلية ↗
IFEval

Instruction following. Provider reports and subset studies retain their scoring and sample-set labels; they do not form a uniform cross-model ranking.

نتائج إضافية؛ لا يوجد مسار مقارنة معياري مشترك محدد.

صفحة الاختبار الأصلية ↗
IFBench

اتباع التعليمات بدقة: 300 مطالبة تتضمن 344 قيدًا قابلًا للتحقق، والدقة الصارمة لكل تعليمة كما يقيسها Swallow LLM Leaderboard.

مصدر المقارنة
Swallow LLM Leaderboard
النسخة / المهام
swallow-evaluation-instruct · ifbench-test-300-prompts-344-instructions
المقياس / الوحدة
inst_level_strict_acc · percent
صفحة الاختبار الأصلية ↗

البرمجة

SWE-bench Verified

نسبة حل 500 مشكلة برمجية واقعية موثقة؛ تستخدم المقارنة الأساسية وكيلًا أدنى موحدًا.

مصدر المقارنة
Vals AI SWE-bench Verified
النسخة / المهام
SWE-bench Verified v1 · verified-500-vals-mini-swe-agent
المقياس / الوحدة
resolved_rate · percent
صفحة الاختبار الأصلية ↗
SWE-rebench v2

حل حديث لمشكلات برمجية ضمن نافذة زمنية محددة.

مصدر المقارنة
SWE-rebench
النسخة / المهام
rolling-v2 · 2026-05-15/2026-07-01
المقياس / الوحدة
resolved_rate · percent
صفحة الاختبار الأصلية ↗
SWE-bench-Live · Lite

حل مشكلات برمجية يتجدد باستمرار مع إبقاء الوكيل والنموذج وجهد الاستدلال المعلن معًا.

مصدر المقارنة
SWE-bench-Live · Lite
النسخة / المهام
SWE-bench-Live Lite · lite-300-python
المقياس / الوحدة
resolved_rate · percent
صفحة الاختبار الأصلية ↗
DeepSWE

مهام هندسة برمجيات أصلية طويلة الأفق مع نتائج منفصلة حسب إطار الوكيل ومستوى الاستدلال.

مصدر المقارنة
DeepSWE official live leaderboard
النسخة / المهام
DeepSWE v1.1 live leaderboard · 113-original-long-horizon-tasks
المقياس / الوحدة
pass_at_1 · percent
صفحة الاختبار الأصلية ↗
SWE-bench Pro Public · Scale

Scale AI Labs' separate 731-task professional software-engineering benchmark. Results keep the submitted model, agent label, confidence interval and row-specific publication date; they are never mixed with SWE-bench Verified, SWE-rebench or vendor supplemental protocols. A July 2026 OpenAI audit reported substantial task-quality concerns, so SWE-Pro should be read as one imperfect signal rather than an absolute model ranking.

مصدر المقارنة
Scale AI Labs · SWE-bench Pro Public
النسخة / المهام
Scale public 731-task leaderboard · public-731
المقياس / الوحدة
resolved_rate · percent
صفحة الاختبار الأصلية ↗
CursorBench

تقييم لوكلاء البرمجة بمستويات استدلال صريحة وبيانات التكلفة والرموز والخطوات.

مصدر المقارنة
Epoch AI mirror · CursorBench
النسخة / المهام
CursorBench current leaderboard · official-current-suite
المقياس / الوحدة
score · percent
صفحة الاختبار الأصلية ↗
FrontierCode 1.1 · Main

مهام برمجية صعبة تركز على قابلية الدمج مع حفظ إطار الوكيل ومستوى الاستدلال لكل نتيجة.

مصدر المقارنة
Epoch AI mirror · FrontierCode 1.1
النسخة / المهام
FrontierCode 1.1 · main-100-hardest-tasks
المقياس / الوحدة
mergeability_rubric_mean_at_5 · percent
صفحة الاختبار الأصلية ↗
IOI

IOI 2024 and 2025 olympiad problems evaluated by Vals AI with olympiad graders.

مصدر المقارنة
Vals AI · IOI
النسخة / المهام
Vals IOI v2 · vals-ioi-2024-2026-overall
المقياس / الوحدة
score · percent
صفحة الاختبار الأصلية ↗
LiveCodeBench

Competitive programming problems released after training cutoffs; Vals AI's independent implementation, overall pass@1.

مصدر المقارنة
Vals AI · LiveCodeBench
النسخة / المهام
Vals LiveCodeBench v1 · vals-livecodebench-overall
المقياس / الوحدة
pass_at_1 · percent
صفحة الاختبار الأصلية ↗
SciCode

برمجة بحثية علمية تقاس بدقة المسائل الفرعية مع اختبارات Python قابلة للتنفيذ.

مصدر المقارنة
Epoch AI mirror · SciCode
النسخة / المهام
SciCode current leaderboard · scientific-research-coding-subproblems
المقياس / الوحدة
subproblem_accuracy · percent
صفحة الاختبار الأصلية ↗
ALE-Bench

Score-based algorithmic optimisation contests (AtCoder Heuristic); performance rating.

مصدر المقارنة
Epoch AI mirror · ALE-Bench
النسخة / المهام
ALE-Bench current leaderboard · atcoder-heuristic-contest-set
المقياس / الوحدة
performance_rating · points
صفحة الاختبار الأصلية ↗
Vibe Code Bench

Building complete web applications from scratch in an agent harness, evaluated by Vals AI.

مصدر المقارنة
Vals AI · Vibe Code Bench
النسخة / المهام
Vals Vibe Code Bench v1.1 · vals-vibe-code-bench-overall
المقياس / الوحدة
score · percent
صفحة الاختبار الأصلية ↗
Text Arena · Coding

تفضيلات بشرية لتطبيقات ويب مولدة باستخدام React وTypeScript.

مصدر المقارنة
Epoch AI mirror · Text Arena (Coding)
النسخة / المهام
Text Arena Coding current pool · text-arena-coding-bradley-terry
المقياس / الوحدة
bradley_terry_rating · points
صفحة الاختبار الأصلية ↗
WeirdML

Unusual machine-learning tasks solved end-to-end by writing and running code.

مصدر المقارنة
Epoch AI mirror · WeirdML
النسخة / المهام
WeirdML v2 current leaderboard · weirdml-v2-task-set
المقياس / الوحدة
accuracy · percent
صفحة الاختبار الأصلية ↗

الوكلاء والأدوات

Terminal-Bench 2.0

Terminal-Bench 2.0 leaderboard over 89 hard terminal tasks; agent harness and run date stay attached to every score.

مصدر المقارنة
Epoch AI mirror · Terminal-Bench 2.0
النسخة / المهام
Terminal-Bench 2.0 · official-89-task-set
المقياس / الوحدة
accuracy_mean · percent
صفحة الاختبار الأصلية ↗
Terminal-Bench 2.1

Vals AI's independent Terminal-Bench 2.1 run with one uniform harness; vendor reports remain supplemental.

مصدر المقارنة
Vals AI · Terminal-Bench 2.1
النسخة / المهام
Vals Terminal-Bench 2.1 v2.1 · vals-terminal-bench-2-1-overall
المقياس / الوحدة
accuracy · percent
صفحة الاختبار الأصلية ↗
Terminal-Bench 3.0

ترتيب رسمي للوكيل والنموذج عبر 74 مهمة طرفية صعبة؛ يبقى الوكيل والجهد وعدد المحاولات مرتبطًا بكل نتيجة.

مصدر المقارنة
Terminal-Bench 3.0
النسخة / المهام
3.0 · b936386b-4afd-4ad7-aa7f-6b52bcab9853 · official-74-task-leaderboard
المقياس / الوحدة
accuracy · percent
صفحة الاختبار الأصلية ↗
τ³-Banking · Official harness

مهام دعم مصرفي متعددة الجولات وكثيفة المعرفة مع استرجاع وأدوات ومستخدم محاكى، كما تنشرها لوحة الصدارة الرسمية.

مصدر المقارنة
τ³-Banking
النسخة / المهام
1.0.1 · banking_knowledge
المقياس / الوحدة
pass_1 · percent
صفحة الاختبار الأصلية ↗
τ³-Banking · Artificial Analysis harness

تشغيل خاص من Artificial Analysis للمجال نفسه: 97 مهمة، استرجاع BM25/grep ومستخدم محاكى مختلف. المحاكي جزء من القياس، لذا فهذا عمود مستقل وليس رأياً ثانياً.

مصدر المقارنة
Artificial Analysis · Intelligence Index evaluations
النسخة / المهام
τ³-Banking (Artificial Analysis) · banking-97-tasks-gpt-5-4-mini-simulator
المقياس / الوحدة
pass_at_1 · percent
صفحة الاختبار الأصلية ↗
MCP-Atlas · Scale

Real-world multi-step tool use across 1,000 tasks, 36 MCP servers and 220 tools. The comparable lane uses Scale's April 2026 rescored protocol, all public and private tasks, a 100-tool-call budget and the exact row-specific publication date.

مصدر المقارنة
Scale AI Labs · MCP-Atlas
النسخة / المهام
MCP-Atlas April 2026 rescored protocol · all-1000-public-500-private-500
المقياس / الوحدة
pass_rate · percent
صفحة الاختبار الأصلية ↗
SkillsBench v1.1

اختبار مدقق للوكلاء عبر 87 مهمة مهنية؛ تبقى بروتوكولات المهارات وغيابها منفصلة.

مصدر المقارنة
SkillsBench v1.1
النسخة / المهام
v1.1 · official-87-tasks-with-skills
المقياس / الوحدة
pass_rate · percent
صفحة الاختبار الأصلية ↗
APEX-Agents

عمل مهني طويل الأفق في الخدمات المصرفية والاستشارات والقانون باستخدام أدوات المكتب وتنفيذ الشيفرة.

مصدر المقارنة
Epoch AI mirror · APEX-Agents
النسخة / المهام
APEX-Agents current leaderboard · 480-professional-tasks-33-worlds
المقياس / الوحدة
pass_at_1 · percent
صفحة الاختبار الأصلية ↗
Berkeley Function Calling Leaderboard V4

استدعاء الدوال واستخدام الأدوات متعدد الجولات ومقاومة الهلوسة في اختبار BFCL V4 الرسمي.

مصدر المقارنة
BFCL V4
النسخة / المهام
v4-ede5081a24bc · overall
المقياس / الوحدة
overall_accuracy · percent
صفحة الاختبار الأصلية ↗
LMArena Agent Arena

Human preference evaluation of agent outcomes. Every score retains the submitted model, disclosed thinking label, confidence interval and observation count.

مصدر المقارنة
LMArena Agent Arena
النسخة / المهام
2026-09-30 · overall-ips-aggregate
المقياس / الوحدة
ips_score · ips
صفحة الاختبار الأصلية ↗
AppWorld

Interactive coding-agent benchmark across controllable applications and APIs; model, method, scaffold and task/scenario metrics remain attached to each run.

مصدر المقارنة
AppWorld official leaderboard
النسخة / المهام
official-c1f56015cf7c · test-challenge-all
المقياس / الوحدة
task_goal_completion · percent
صفحة الاختبار الأصلية ↗
Vending-Bench 2

Long-horizon business simulation: mean final balance in USD after a simulated year.

مصدر المقارنة
Epoch AI mirror · Vending-Bench 2
النسخة / المهام
Vending-Bench 2 current leaderboard · one-simulated-year-mean-final-balance
المقياس / الوحدة
mean_final_balance_usd · USD
صفحة الاختبار الأصلية ↗
GDPval-AA v2.1

Successor of GDPval-AA v2: the same 220 tasks and judges, Elo refitted and pinned to DeepSeek V4.1 Flash (max) at 1600 - not comparable with v2 values.

مصدر المقارنة
Artificial Analysis · Intelligence Index evaluations
النسخة / المهام
GDPval-AA v2.1 (Crowd-BT Elo, DeepSeek V4.1 Flash (max) at 1600) · 220-tasks-elo-v2-1
المقياس / الوحدة
elo · points
صفحة الاختبار الأصلية ↗

ماذا تخبرنا البيانات فعلاً؟

لا نكتفي بمعرفة النموذج الأعلى نقاطاً. توضح هذه التحليلات أين تدعم الأدلة المقارنة، وأين تنقص القياسات، وأي استنتاجات تتجاوز ما تسمح به البيانات.

تُحسب المؤشرات من لقطة البيانات نفسها المستخدمة في الجدول. التفسير من LLM Benchmarks، والقياسات من المصادر المذكورة.

كيف تستخدم هذه التحليلات؟

يؤثر اختيار النماذج وتوفر الاختبارات المنشورة في كل تحليل. المزيد من الأدلة يعني معلومات أكثر قابلة للفحص، لا نموذجاً أفضل بالضرورة. لذلك نذكر وحدة العد وتاريخ البيانات والحدود. يُعاد حساب التحليلات مع البيانات المنشورة، وهي ليست إعادة مستقلة لإجراء الاختبارات.

اقرأ مقارنات النماذج ودراسات الحالة →

01

النماذج المفتوحة الصغيرة: ما الأدلة التي تدعم المقارنة؟

يتطلب اختيار نموذج مفتوح صغير أكثر من نتيجة جيدة منفردة. نفحص النماذج المختارة التي يقل إجمالي معاملاتها عن ٣٦ ملياراً، لمعرفة عدد أزواج النموذج والاختبار المدعومة بالأدلة، وأين تتوفر أدلة قابلة للمقارنة المباشرة.

تساعد التغطية الواسعة على إعداد قائمة مختصرة. إنها مقياس للأدلة المتاحة، وليست ترتيباً للجودة أو بياناً لاحتياجات الذاكرة.

ما مقدار الأدلة المتاحة؟

يتكون الزوج من نموذج واحد واختبار واحد من الجدول الكامل. تُحسب مستويات التفكير المتعددة مرة واحدة، ولا تُحسب دراسات التكميم دليلاً للنموذج الأساسي. تتطلب صفة «قابل للمقارنة» نتيجة واحدة على الأقل خالية من التعارض وتحمل هذه الصفة في الجدول. يشمل العد جميع الإعدادات الأساسية المسجلة، لا العرض المصفّى الحالي فقط.

11النماذج المختارة
171 / 506أزواج النموذج والاختبار الموثقة
100منها بأدلة قابلة للمقارنة
تغطية القياسات حسب المجال

يشمل كل شريط جميع الأزواج الممكنة في مجاله. الأعداد: القابلة للمقارنة / الموثقة / الممكنة.

نظرة عامة19 / 19 / 44
المعرفة والاستدلال34 / 71 / 165
البرمجة27 / 46 / 154
الوكلاء والأدوات20 / 35 / 143
دليل قابل للمقارنةأدلة إضافية فقطلا يوجد دليل مسجل

عدّ أجريناه من البيانات العامة. تاريخ البيانات: . JSON · CSV

ماذا يعني ذلك لاختيار النموذج؟

ابحث أولاً عن أدلة في مجال مهمتك. كثرة قياسات المعرفة لا تسد نقص تقييمات وكلاء البرمجة. قارن بعد ذلك الاختبارات المشتركة بين مرشحيك وافحص البروتوكول. لا نستنتج إجمالي المعاملات المجهول من اسم النموذج، ولا يؤهله ذلك للدخول في تحليل ما دون ٣٦ ملياراً.

تمثل الأجزاء الفاتحة من الرسم فجوات المعلومات في بياناتنا. ربما اختُبر نموذج في مكان آخر دون أن نملك سجلاً قابلاً للنشر. كما أن اختيار النماذج منظم. لذلك لا تثبت الأعمدة تفوقاً عاماً للنماذج المفتوحة أو المغلقة.

إعادة حساب التحليل

في ملف JSON، اختر النماذج المفتوحة ذات العدد الإجمالي الموثق للمعاملات الأكبر من صفر والأقل من ٣٦ ملياراً. استخدم اختبارات الموقع فقط. اجمع أدلة النموذج الأساسي مرة واحدة لكل نموذج واختبار، وافصل النسخ المكمّمة. تشمل البيانات نتائج أقدم ما زالت صالحة للنشر. وافحص تواريخ القياسات الفردية قبل اتخاذ قرار الاستخدام.

02

الاختبار نفسه في ظروف مختلفة

قد تكون نتيجتان منشورتان صحيحتين دون أن تسمحا بحساب فرق عادل. نعد أزواج النماذج والاختبارات التي تملك أدلة قابلة للمقارنة، ونشرح الفرق باستخدام مسارات التقييم لدينا.

وجود قياسات مشتركة لا يعني تلقائياً قابلية المقارنة المباشرة. يجب تطابق النسخة والمهام والإعداد قبل حساب الفرق.

التوثيق لا يعني دائماً قابلية المقارنة

يعد التحليل الأزواج عبر جميع النماذج المختارة واختبارات الموقع. يُعد الزوج موثقاً عند وجود نتيجة أساسية واحدة على الأقل. وتحتاج قابلية المقارنة أيضاً إلى دليل خالٍ من التعارض يحمل الحالة المقابلة في الجدول. أما البقية فلا تضم إلا أدلة إضافية أو غير قابلة للمقارنة المباشرة. ولا نكرر عد مستويات التفكير.

100النماذج المختارة
2,221 / 4,600أزواج النموذج والاختبار الموثقة
1,991منها بأدلة قابلة للمقارنة
تغطية القياسات حسب المجال

يشمل كل شريط جميع الأزواج الممكنة في مجاله. الأعداد: القابلة للمقارنة / الموثقة / الممكنة.

نظرة عامة275 / 275 / 400
المعرفة والاستدلال705 / 816 / 1,500
البرمجة589 / 683 / 1,400
الوكلاء والأدوات422 / 447 / 1,300
دليل قابل للمقارنةأدلة إضافية فقطلا يوجد دليل مسجل

عدّ أجريناه من البيانات العامة. تاريخ البيانات: . JSON · CSV

ثلاث حالات يكون فيها الفرق مضللاً

SWE-bench: يمثل نموذج داخل وكيل مزود ونموذج آخر داخل بيئة تقييم موحدة نظامين مختلفين في البداية. تستخدم مقارنتنا الصارمة لـ Verified مسار Vals المحدد. وفي Pro تبقى نتائج الأنظمة المبلغ عنها منفصلة عن المسار القابل للمقارنة المباشرة.

HLE: تختلف مقامات النسب بين مجموعة المهام الكاملة والمجموعة النصية. ويغير استخدام الأدوات أيضاً طرق الحل المسموح بها. لذلك لا يعزل الفرق بالنقاط المئوية بين هذين الإعدادين تحسن النموذج.

SWE-rebench: تغير مجموعات المهام يعني تغير المشكلات المطلوبة. وقد تشكل مجموعة أقدم موثقة مجموعة مقارنة مستقلة. ترتيبها خاص بها، ولا يجوز مساواته بترتيب المجموعة الحالية.

مقارنة مبررة في ثلاث خطوات

اختر نموذجين إلى أربعة ومجالاً مناسباً. اقتصر على الاختبارات المقاسة لجميع النماذج المختارة. ثم افحص مؤشرات قابلية المقارنة والتفاصيل قبل تفسير الفروق مع النموذج المرجعي. حتى الفرق الصحيح تقنياً لا يُعد اختباراً للدلالة الإحصائية.

خلاصتنا: تضيف نتيجة مزود أخرى معلومات، لكنها لا تنشئ تلقائياً ترتيباً عادلاً جديداً. إظهار هذا الفرق أنفع من فرض جميع النتائج على ترتيب واحد.

03

التفكير الأكثر لا يضمن نتيجة أفضل

كثيراً ما يُفترض أن زيادة الحساب تؤدي إلى نتيجة أفضل. نبحث في البيانات المنشورة عن أمثلة موثقة يحصل فيها مستوى تفكير ثابت أعلى على نتيجة أسوأ ضمن إعداد التقييم المعلن نفسه.

ينقض المثال المضاد افتراض التحسن المضمون. ولا يعني أن التفكير الأقل أفضل بوجه عام.

أمثلة من لقطة البيانات هذه

نقارن مستويات ثابتة موثقة للنموذج والمصدر ونسخة الاختبار ومجموعة المهام والمقياس والأدوات وتنسيق الوكيل والتقييم نفسها. ويجب تطابق أعداد العينات المبلغ عنها أيضاً. نستخدم أدلة حديثة وحالية من المسار المعتمد، دون تعارض أو تحذير من التلوث. وتُستبعد النتائج المتعددة الملتبسة عند مستوى واحد.

Claude Fable 5.1 · CritPt
xhigh31.1 %
max29.7 %

CritPt current leaderboard · Epoch AI mirror · CritPt

التواريخ المعتمدة للأدلة: 2 سبتمبر 2026 / 2 سبتمبر 2026. ليس دليلاً على أثر سببي للتفكير.

Claude Fable 5 · Vending 2
high5680.26 USD
max4966.64 USD

Vending-Bench 2 current leaderboard · Epoch AI mirror · Vending-Bench 2

التواريخ المعتمدة للأدلة: 2 سبتمبر 2026 / 2 سبتمبر 2026. ليس دليلاً على أثر سببي للتفكير.

Claude Opus 4.7 · ARC-AGI-1
high93.5 %
max92.0 %

ARC-AGI-1 current leaderboard · Epoch AI mirror · ARC-AGI-1

التواريخ المعتمدة للأدلة: 2 سبتمبر 2026 / 2 سبتمبر 2026. ليس دليلاً على أثر سببي للتفكير.

ما الذي تثبته هذه الأمثلة؟

هذه أمثلة مضادة مختارة عمداً، وليست عينة ممثلة أو تقديراً لمعدل التكرار. وقد تظل اختلافات تواريخ التقييم والإعدادات غير المعلنة مؤثرة. لا يمكن تحديد سبب فرق النتائج دون تكرار التجارب وتحليل مناسب لعدم اليقين.

لذلك يعرض الجدول افتراضياً أعلى مستوى موثق ضمن سلسلة الاختبارات المختارة، بدلاً من اختيار أفضل نتيجة بأثر رجعي بين المستويات. وهذا يجعل قاعدة الاختيار قابلة للتتبع. اختبر الجودة وزمن الاستجابة والتكلفة معاً في تطبيقك؛ فنتائج الجودة وحدها هنا لا تشكل ترتيباً للكفاءة.

من يدير هذا الموقع؟

يدير Christopher Böhm مشروع LLM Benchmarks بصفة خاصة. يجمع المشروع تقييمات النماذج المنشورة ومصادرها وحدودها للمقارنة في مكان واحد.

الاختيار القابل للتتبع أهم لدينا من قائمة تبدو حاسمة. يجب أن تتيح كل مقارنة الرجوع إلى أدلتها.

ما الذي نضيفه؟

نطابق هويات النماذج ونسخ الاختبارات، ونفصل ظروف الاختبار المختلفة، ونوضح المعلومات غير المؤكدة أو المتعارضة، ونوفر أدوات المقارنة والتنزيل. تشرح الأدلة والتحليلات هذه القرارات. ولا ننسب قياسات الجهات الأخرى إلى أنفسنا بوصفها اختبارات أجريناها.

المسؤولية والصيانة

Christopher Böhm هو المشغّل وجهة التواصل. جمع البيانات والفحوص التقنية مؤتمتان جزئياً. تُدار قواعد النشر ونسبة المصادر والأدلة الإضافية المختارة ضمن المشروع. وقد تنقل الأتمتة أخطاء المصادر، ولذلك تعد روابط المصادر وتفاصيل القياس ووسيلة طلب التصحيح جزءاً من الخدمة.

التمويل وقواعد الاختيار

يقبل المشغّل دعماً طوعياً عبر PayPal. والموقع مُعد أيضاً لمساحة إعلانية يدوية من AdSense. تخضع إضافة النماذج واختيار القياسات والترتيب لقواعد البيانات الموضحة في المنهجية. توثيق المصدر يحدد منشأ النتيجة ولا يمثل توصية بمنتج.

التواصل والتصحيحات

هل وجدت نتيجة خاطئة أو تعريفاً غير صحيح لنموذج أو قيداً غير مذكور؟ أرسل اسم النموذج والاختبار والمعلومة المعنية، ومعها مصدر أصلي إن أمكن. نرحب أيضاً باقتراح اختبارات منشورة لم تُدرج بعد. يرجى عدم إرسال بيانات سرية.