قياسات موثقة بالمصادر
الأدلة والمنهجية
افهم الاختبارات وقارن القياسات بإنصاف واستكشف مصادر LLM Benchmarks. منهجية العمل ودليل الاختبارات وتحليلات تستند إلى البيانات.
من أين تأتي النتائج؟
تصبح النتيجة مفيدة عندما نعرف النموذج الذي خضع للاختبار والظروف التي اختُبر فيها. نوضح هنا كيف نختار النتائج المنشورة ونتحقق منها ونعرضها في جدول المقارنة.
تتمثل مساهمتنا في جمع الأدلة والتحقق منها. أما التقييمات الأصلية فتجريها الجهات المسؤولة عن الاختبارات ومزودو النماذج المشار إليهم في الروابط.
١. ما النماذج والمصادر المشمولة؟
يجمع الاختيار بين نماذج Epoch Capabilities Index وتقييمات صعبة أخرى وإصدارات حديثة تحققنا منها لدى المزودين، مع حصة مخصصة للنماذج المفتوحة. ويشمل ذلك نماذج صغيرة لا تحظى بتمثيل واسع في قوائم الترتيب الكبرى. إنها عينة من السوق وليست دليلاً شاملاً لكل النماذج.
نستخدم نتائج الجهات المسؤولة عن الاختبارات والتقييمات المستقلة وتقارير المزودين الموثقة. يجب أن تكون هوية النموذج والمصدر ونسخة الاختبار وشروط النشر قابلة للتتبع. إتاحة نتيجة للعامة لا تعني تلقائياً السماح بإعادة نشرها. وتظل تقارير المزودين منسوبة إلى أصحابها.
٢. متى يمكن مقارنة نتيجتين؟
اسم الاختبار وحده لا يكفي. نراعي الإصدار والنسخة ومجموعة المهام أو فترتها والمقياس والوحدة والأدوات وإعداد الوكيل وإجراء التقييم. لكل اختبار مسار مقارنة محدد. وقد تضيف الإعدادات الأخرى أدلة مفيدة، لكنها لا تحصل ضمنياً على مكانة الترتيب نفسها.
- الترتيب: موقع النموذج ضمن بروتوكول الاختبار المؤهل للمقارنة، وليس حكماً عاماً على النموذج.
- ≈: دليل إضافي في ظروف مختلفة. ينبغي مراجعة تفاصيل القياس أولاً.
- تعارض: اختلاف مصادر موثوقة بشأن الإعداد الموثق نفسه. لا يوجد ترتيب واحد يمكن الاعتماد عليه.
- خلية فارغة: لا يوجد قياس ظاهر مطابق. ولا يعني ذلك صفراً من النقاط أو فشلاً في الاختبار.
٣. أي مستوى من التفكير نختار؟
ضمن المصدر وسلسلة الاختبارات نفسيهما، نفضل أعلى مستوى ثابت موثق: max ثم xhigh ثم high ثم medium ثم low ثم minimal ثم off. لا نختار لاحقاً النتيجة الأعلى نقاطاً. لذلك قد تكون نتيجة Max الصحيحة أقل من High. ولا نخلط بين الوكلاء أو نسخ الاختبار أو مجموعات المهام للوصول إلى مستوى أعلى.
تعني Adaptive أن التفكير مفعّل، لكنها لا تثبت ميزانية قصوى ثابتة. وتظل الإعدادات غير المعلنة مجهولة. كما أن تسمية High لدى مزودين مختلفين لا تعني بالضرورة ميزانية حسابية متساوية.
٤. ماذا تعني التواريخ ودرجات المصادر؟
تاريخ التقييم والنشر ونسخة البيانات وأول رصد أحداث مختلفة. عندما لا يحدد المصدر تاريخ تشغيل معين، قد نستخدم أول مرة رُصدت فيها تلك النتيجة الدقيقة. وهذا لا يثبت أن التقييم حديث. توضح تفاصيل القياس الأساس الذي استند إليه التاريخ.
نقيّم موثوقية المصدر وجودة الأدلة بشكل منفصل. الفئات A+ وA وB وC هي تصنيفاتنا للمصادر والأدلة، وليست احتمالات إحصائية لصحة النتيجة. ولا تلغي الدرجة العالية للمصدر اختلاف ظروف الاختبار.
٥. ما الذي لا يثبته الجدول؟
لا تثبت الفروق الصغيرة تفوقاً في الأداء دون تحليل مناسب لعدم اليقين. النقاط المئوية ليست نسبة تحسن مئوية نسبية. كما يقيس المؤشر المركب شيئاً مختلفاً عن النجاح في مهمة محددة؛ ولا نحسب متوسط الأعمدة لإنشاء نتيجة إجمالية خاصة بنا.
تظل نتائج التكميم والأجهزة دراسات إضافية. اختلاف محركات التنفيذ أو وحدات GPU أو مجموعات المهام يمنع عزل أثر التكميم وحده. حجم ملفات الأوزان وسعة GPU واستهلاك الذاكرة المقاس مقادير مختلفة. اختبارات الأجهزة المنشورة ليست قياسات مخبرية أجرتها LLM Benchmarks.
٦. فحص الأدلة والإبلاغ عن الأخطاء
افتح قيمة في الجدول للاطلاع على المصدر وإعداد الاختبار والتاريخ ومستويات التفكير المتاحة. يمكن تنزيل البيانات بصيغتي CSV وJSON. عند الإبلاغ عن خطأ، اذكر النموذج والاختبار والقيمة المعنية ورابطاً للدليل الأصلي. تُفحص المصادر المتغيرة مجدداً وفق قواعد النشر، وتُصحح الأخطاء المؤكدة في البيانات.
ماذا يقيس كل اختبار؟
يعتمد المقياس المفيد على مهمتك. فمؤشر القدرات العامة واختبار المعرفة وتقييم وكيل البرمجة تقيس أشياء مختلفة. يساعد هذا الدليل على تفسير كل نوع من النتائج.
ابدأ بالمهمة، ثم افحص بروتوكول التقييم، وبعد ذلك قارن النتائج.
القدرات العامة: ECI والمؤشرات المركبة
يجمع Epoch Capabilities Index نتائج اختبارات مختلفة على مقياس مشترك للقدرات. ويقدم نظرة أولية عبر مجالات متعددة. قيمته ليست نسبة المهام المحلولة. وقد تغير البيانات الجديدة التقديرات حتى لنماذج لم تتغير.
تفسيرنا: استخدم المؤشر لإعداد قائمة مختصرة، ثم افحص الاختبارات المناسبة لعملك. قد يناسبك مساعد متخصص رغم انخفاض مؤشره العام. ولا ينبغي طرح درجات مؤشرات مختلفة بعضها من بعض.
المعرفة والاستدلال: GPQA وHLE والرياضيات
يتضمن GPQA أسئلة صعبة أعدها متخصصون في الأحياء والفيزياء والكيمياء. يعتمد الجدول مجموعة Diamond الفرعية. تقدم هذه الاختبارات أدلة على حل المشكلات ضمن الإعداد المحدد، ولا تقيس تلقائياً الموثوقية في البحث المفتوح.
نبقي مجموعة HLE الكاملة ومجموعتها النصية منفصلتين. وقد يغير الوصول إلى الأدوات طبيعة المهمة. في الرياضيات، تُعد صعوبة المهام أساسية: النجاح في مجموعة أقدم أو أسهل لا يثبت الأداء في مهام جديدة صعبة. ولتطبيق معرفي، نختبر أيضاً أسئلتك الخاصة مع مصادر يمكن التحقق منها.
البرمجة: مهمة منفردة أم وكيل كامل؟
قد يقيّم اختبار البرمجة مسألة مستقلة أو وكيلاً يعمل في مستودع برمجي قائم. يقيّم SWE-bench مشكلات برمجية حقيقية. وتؤثر الأدوات وتنسيق عمل الوكيل وبيئة الاختبار أيضاً في النتيجة.
تفسيرنا: عند اختيار وكيل برمجة، قارن إعدادات أنظمة موثقة. وقد يكون اختبار أضيق أنسب للدوال الفردية. لا يمكن اعتبار Verified وPro ومجموعات Rebench المتغيرة بدائل متكافئة. النجاح في مجموعة لا يتنبأ بالنجاح في مستودعك.
الوكلاء والأدوات: سير العمل جزء من الاختبار
تتطلب اختبارات الطرفية واستخدام الأدوات والوكلاء متعددي الجولات أن يتصرف النموذج داخل بيئة محددة. تدخل واجهات API المتاحة وإعداد الوكيل وحدود الوقت وعدد الاستدعاءات في معنى النتيجة. لهذا نبقي مثلاً إعدادَي Banking منفصلين في الجدول.
تفسيرنا: تفيد هذه النتائج خصوصاً عندما يشبه الاختبار سير عملك. وإلا تبقى جوانب أساسية دون تقييم، مثل الصلاحيات والتعافي من الأخطاء ومعايير نجاحك الخاصة. افحص تفاصيل القياس وجرّب مجموعة صغيرة من حالات الاستخدام الممثلة لعملك.
قراءة تقييمات التعليمات والتفضيلات
يفحص IFEval تعليمات يمكن التحقق منها موضوعياً، مثل قيود المخرجات المطلوبة. يفيد ذلك إذا اعتمد عملك على الالتزام بمتطلبات محددة. لكنه لا يثبت دقة الحقائق بصورة شاملة أو الجودة التخصصية لكل إجابة.
تعكس قوائم Arena تفضيلات وفق إجراء المقارنة المستخدم. وليست الإجابة المفضلة صحيحة بالضرورة. تفسيرنا: قد تساعد أدلة التفضيل على اختيار أسلوب الكتابة، لكن التحقق من الصحة يحتاج أيضاً إلى فحوص متخصصة بالمجال.
جميع اختبارات جدول المقارنة
يربط الدليل التالي بالصفحات الأصلية ويحدد مسارات المقارنة المعتمدة لدينا. معلومات النسخة والمهام أهم من تشابه أسماء الاختبارات. يساعد التصنيف على التصفح، ولا يمثل أوزاناً لترتيب إجمالي.
نظرة عامة
Epoch Capabilities Index
مؤشر قدرات مركّب صممته Epoch AI اعتمادًا على أكثر من 50 اختبارًا.
- مصدر المقارنة
- Epoch Capabilities Index
- النسخة / المهام
- Epoch ECI snapshot 2026-10-01 · official-composite-fit
- المقياس / الوحدة
- eci · index_points
Artificial Analysis Intelligence Index
Artificial Analysis' composite Intelligence Index; one value per model and reasoning setting. The protocol identifies the methodology version.
- مصدر المقارنة
- Artificial Analysis · Intelligence Index evaluations
- النسخة / المهام
- Artificial Analysis Intelligence Index v4.3 · intelligence-index-v4-3
- المقياس / الوحدة
- index_score · points
Arena Text
ترتيب نماذج النص وفق التفضيلات البشرية.
- مصدر المقارنة
- Arena Text
- النسخة / المهام
- 2026-09-30 · overall-style-control
- المقياس / الوحدة
- arena_score · points
LiveBench
تقييم موضوعي واسع القدرات يُحدَّث بصورة متكررة.
- مصدر المقارنة
- LiveBench
- النسخة / المهام
- 2026-06-25 · overall-seven-category
- المقياس / الوحدة
- category_balanced_average · percent
المعرفة والاستدلال
Humanity's Last Exam · Full multimodal
تستخدم القيم القابلة للمقارنة بروتوكول HLE الكامل متعدد الوسائط المكوّن من 2500 سؤال من دون أدوات؛ وتبقى البروتوكولات الأخرى منفصلة.
- مصدر المقارنة
- Scale AI Labs · Humanity's Last Exam Full
- النسخة / المهام
- HLE finalized 2,500 · Scale protocol 2025-04-03 · full-multimodal-2500-no-tools
- المقياس / الوحدة
- accuracy · percent
Humanity's Last Exam · Text-only
المجموعة النصية من Artificial Analysis: 2158 من أصل 2500 سؤال، من دون أدوات. مجموعة أسئلة مختلفة، وليست قياساً أضعف للبروتوكول الكامل.
- مصدر المقارنة
- Artificial Analysis · Intelligence Index evaluations
- النسخة / المهام
- HLE text-only (Artificial Analysis) · text-only-2158-no-tools
- المقياس / الوحدة
- accuracy · percent
SimpleQA Verified
المعرفة الواقعية في الإجابات القصيرة وجودة الامتناع عن الإجابة.
- مصدر المقارنة
- Epoch AI SimpleQA Verified
- النسخة / المهام
- Epoch independent Inspect runs · verified-1000-epoch-inspect
- المقياس / الوحدة
- accuracy · percent
GPQA Diamond
أسئلة علوم بمستوى الدراسات العليا في الفيزياء والكيمياء والأحياء.
- مصدر المقارنة
- Vals AI GPQA Diamond
- النسخة / المهام
- GPQA Diamond v1 · Vals dual-prompt · diamond-198-zero-and-five-shot-cot
- المقياس / الوحدة
- accuracy · percent
MMLU-Pro
Broad academic multiple-choice knowledge and reasoning across fourteen subjects; Vals AI's independent run over the MMLU-Pro set.
- مصدر المقارنة
- Vals AI · MMLU-Pro
- النسخة / المهام
- Vals MMLU-Pro v1 · vals-mmlu-pro-overall
- المقياس / الوحدة
- accuracy · percent
FrontierMath T1–3
تشغيلات مستقلة من Epoch AI على 295 مسألة رياضيات متقدمة أعدها خبراء؛ ويظل المستوى الرابع منفصلًا.
- مصدر المقارنة
- Epoch AI · FrontierMath Tiers 1–3 v2
- النسخة / المهام
- 2.0.0 · private-285-of-295-problem-tiers-1-3-set
- المقياس / الوحدة
- mean_score · percent
ARC-AGI-2
استقراء قواعد مجردة عبر 360 مهمة تقييم مع فصل متغيرات pass@2 حسب جهد الاستدلال.
- مصدر المقارنة
- ARC-AGI-2
- النسخة / المهام
- v2 · semi-private-120
- المقياس / الوحدة
- accuracy · percent
FrontierMath T4
Independent Epoch AI runs on the 41 private research-level problems from the 43-problem FrontierMath Tier 4 v2 set; the two public examples and Tiers 1–3 are not mixed into this column.
- مصدر المقارنة
- Epoch AI · FrontierMath Tier 4 v2
- النسخة / المهام
- 2.0.0 · private-41-of-43-problem-tier-4-set
- المقياس / الوحدة
- mean_score · percent
MMMU-Pro
معرفة خبراء واستدلال متعدد الوسائط.
- مصدر المقارنة
- Vals AI · MMMU-Pro
- النسخة / المهام
- Vals MMMU-Pro v1 · vals-mmmu-pro-overall
- المقياس / الوحدة
- accuracy · percent
CritPt
Research-level physics reasoning across 71 open-ended challenges graded automatically.
- مصدر المقارنة
- Artificial Analysis · Intelligence Index evaluations
- النسخة / المهام
- CritPt (Artificial Analysis) · 70-challenges-official-grading
- المقياس / الوحدة
- accuracy · percent
SimpleBench
Trick-question common-sense reasoning where humans still beat frontier models; average of five runs.
- مصدر المقارنة
- Epoch AI mirror · SimpleBench
- النسخة / المهام
- SimpleBench current leaderboard · official-set-avg-at-5
- المقياس / الوحدة
- accuracy_avg_at_5 · percent
Chess Puzzles
Epoch AI's 100 engine-generated chess puzzles with one best move each, run and dated by Epoch.
- مصدر المقارنة
- Epoch AI · Chess Puzzles
- النسخة / المهام
- Epoch AI Chess Puzzles v1 · 100-engine-generated-single-best-move-puzzles
- المقياس / الوحدة
- mean_score · percent
ARC-AGI-1
Original ARC-AGI abstraction puzzles on the semi-private set as reported by ARC Prize.
- مصدر المقارنة
- Epoch AI mirror · ARC-AGI-1
- النسخة / المهام
- ARC-AGI-1 current leaderboard · semi-private-evaluation-pass-at-2
- المقياس / الوحدة
- pass_at_2_accuracy · percent
IFEval
Instruction following. Provider reports and subset studies retain their scoring and sample-set labels; they do not form a uniform cross-model ranking.
نتائج إضافية؛ لا يوجد مسار مقارنة معياري مشترك محدد.
صفحة الاختبار الأصلية ↗IFBench
اتباع التعليمات بدقة: 300 مطالبة تتضمن 344 قيدًا قابلًا للتحقق، والدقة الصارمة لكل تعليمة كما يقيسها Swallow LLM Leaderboard.
- مصدر المقارنة
- Swallow LLM Leaderboard
- النسخة / المهام
- swallow-evaluation-instruct · ifbench-test-300-prompts-344-instructions
- المقياس / الوحدة
- inst_level_strict_acc · percent
البرمجة
SWE-bench Verified
نسبة حل 500 مشكلة برمجية واقعية موثقة؛ تستخدم المقارنة الأساسية وكيلًا أدنى موحدًا.
- مصدر المقارنة
- Vals AI SWE-bench Verified
- النسخة / المهام
- SWE-bench Verified v1 · verified-500-vals-mini-swe-agent
- المقياس / الوحدة
- resolved_rate · percent
SWE-rebench v2
حل حديث لمشكلات برمجية ضمن نافذة زمنية محددة.
- مصدر المقارنة
- SWE-rebench
- النسخة / المهام
- rolling-v2 · 2026-05-15/2026-07-01
- المقياس / الوحدة
- resolved_rate · percent
SWE-bench-Live · Lite
حل مشكلات برمجية يتجدد باستمرار مع إبقاء الوكيل والنموذج وجهد الاستدلال المعلن معًا.
- مصدر المقارنة
- SWE-bench-Live · Lite
- النسخة / المهام
- SWE-bench-Live Lite · lite-300-python
- المقياس / الوحدة
- resolved_rate · percent
DeepSWE
مهام هندسة برمجيات أصلية طويلة الأفق مع نتائج منفصلة حسب إطار الوكيل ومستوى الاستدلال.
- مصدر المقارنة
- DeepSWE official live leaderboard
- النسخة / المهام
- DeepSWE v1.1 live leaderboard · 113-original-long-horizon-tasks
- المقياس / الوحدة
- pass_at_1 · percent
SWE-bench Pro Public · Scale
Scale AI Labs' separate 731-task professional software-engineering benchmark. Results keep the submitted model, agent label, confidence interval and row-specific publication date; they are never mixed with SWE-bench Verified, SWE-rebench or vendor supplemental protocols. A July 2026 OpenAI audit reported substantial task-quality concerns, so SWE-Pro should be read as one imperfect signal rather than an absolute model ranking.
- مصدر المقارنة
- Scale AI Labs · SWE-bench Pro Public
- النسخة / المهام
- Scale public 731-task leaderboard · public-731
- المقياس / الوحدة
- resolved_rate · percent
CursorBench
تقييم لوكلاء البرمجة بمستويات استدلال صريحة وبيانات التكلفة والرموز والخطوات.
- مصدر المقارنة
- Epoch AI mirror · CursorBench
- النسخة / المهام
- CursorBench current leaderboard · official-current-suite
- المقياس / الوحدة
- score · percent
FrontierCode 1.1 · Main
مهام برمجية صعبة تركز على قابلية الدمج مع حفظ إطار الوكيل ومستوى الاستدلال لكل نتيجة.
- مصدر المقارنة
- Epoch AI mirror · FrontierCode 1.1
- النسخة / المهام
- FrontierCode 1.1 · main-100-hardest-tasks
- المقياس / الوحدة
- mergeability_rubric_mean_at_5 · percent
IOI
IOI 2024 and 2025 olympiad problems evaluated by Vals AI with olympiad graders.
- مصدر المقارنة
- Vals AI · IOI
- النسخة / المهام
- Vals IOI v2 · vals-ioi-2024-2026-overall
- المقياس / الوحدة
- score · percent
LiveCodeBench
Competitive programming problems released after training cutoffs; Vals AI's independent implementation, overall pass@1.
- مصدر المقارنة
- Vals AI · LiveCodeBench
- النسخة / المهام
- Vals LiveCodeBench v1 · vals-livecodebench-overall
- المقياس / الوحدة
- pass_at_1 · percent
SciCode
برمجة بحثية علمية تقاس بدقة المسائل الفرعية مع اختبارات Python قابلة للتنفيذ.
- مصدر المقارنة
- Epoch AI mirror · SciCode
- النسخة / المهام
- SciCode current leaderboard · scientific-research-coding-subproblems
- المقياس / الوحدة
- subproblem_accuracy · percent
ALE-Bench
Score-based algorithmic optimisation contests (AtCoder Heuristic); performance rating.
- مصدر المقارنة
- Epoch AI mirror · ALE-Bench
- النسخة / المهام
- ALE-Bench current leaderboard · atcoder-heuristic-contest-set
- المقياس / الوحدة
- performance_rating · points
Vibe Code Bench
Building complete web applications from scratch in an agent harness, evaluated by Vals AI.
- مصدر المقارنة
- Vals AI · Vibe Code Bench
- النسخة / المهام
- Vals Vibe Code Bench v1.1 · vals-vibe-code-bench-overall
- المقياس / الوحدة
- score · percent
Text Arena · Coding
تفضيلات بشرية لتطبيقات ويب مولدة باستخدام React وTypeScript.
- مصدر المقارنة
- Epoch AI mirror · Text Arena (Coding)
- النسخة / المهام
- Text Arena Coding current pool · text-arena-coding-bradley-terry
- المقياس / الوحدة
- bradley_terry_rating · points
WeirdML
Unusual machine-learning tasks solved end-to-end by writing and running code.
- مصدر المقارنة
- Epoch AI mirror · WeirdML
- النسخة / المهام
- WeirdML v2 current leaderboard · weirdml-v2-task-set
- المقياس / الوحدة
- accuracy · percent
الوكلاء والأدوات
Terminal-Bench 2.0
Terminal-Bench 2.0 leaderboard over 89 hard terminal tasks; agent harness and run date stay attached to every score.
- مصدر المقارنة
- Epoch AI mirror · Terminal-Bench 2.0
- النسخة / المهام
- Terminal-Bench 2.0 · official-89-task-set
- المقياس / الوحدة
- accuracy_mean · percent
Terminal-Bench 2.1
Vals AI's independent Terminal-Bench 2.1 run with one uniform harness; vendor reports remain supplemental.
- مصدر المقارنة
- Vals AI · Terminal-Bench 2.1
- النسخة / المهام
- Vals Terminal-Bench 2.1 v2.1 · vals-terminal-bench-2-1-overall
- المقياس / الوحدة
- accuracy · percent
Terminal-Bench 3.0
ترتيب رسمي للوكيل والنموذج عبر 74 مهمة طرفية صعبة؛ يبقى الوكيل والجهد وعدد المحاولات مرتبطًا بكل نتيجة.
- مصدر المقارنة
- Terminal-Bench 3.0
- النسخة / المهام
- 3.0 · b936386b-4afd-4ad7-aa7f-6b52bcab9853 · official-74-task-leaderboard
- المقياس / الوحدة
- accuracy · percent
τ³-Banking · Official harness
مهام دعم مصرفي متعددة الجولات وكثيفة المعرفة مع استرجاع وأدوات ومستخدم محاكى، كما تنشرها لوحة الصدارة الرسمية.
- مصدر المقارنة
- τ³-Banking
- النسخة / المهام
- 1.0.1 · banking_knowledge
- المقياس / الوحدة
- pass_1 · percent
τ³-Banking · Artificial Analysis harness
تشغيل خاص من Artificial Analysis للمجال نفسه: 97 مهمة، استرجاع BM25/grep ومستخدم محاكى مختلف. المحاكي جزء من القياس، لذا فهذا عمود مستقل وليس رأياً ثانياً.
- مصدر المقارنة
- Artificial Analysis · Intelligence Index evaluations
- النسخة / المهام
- τ³-Banking (Artificial Analysis) · banking-97-tasks-gpt-5-4-mini-simulator
- المقياس / الوحدة
- pass_at_1 · percent
MCP-Atlas · Scale
Real-world multi-step tool use across 1,000 tasks, 36 MCP servers and 220 tools. The comparable lane uses Scale's April 2026 rescored protocol, all public and private tasks, a 100-tool-call budget and the exact row-specific publication date.
- مصدر المقارنة
- Scale AI Labs · MCP-Atlas
- النسخة / المهام
- MCP-Atlas April 2026 rescored protocol · all-1000-public-500-private-500
- المقياس / الوحدة
- pass_rate · percent
SkillsBench v1.1
اختبار مدقق للوكلاء عبر 87 مهمة مهنية؛ تبقى بروتوكولات المهارات وغيابها منفصلة.
- مصدر المقارنة
- SkillsBench v1.1
- النسخة / المهام
- v1.1 · official-87-tasks-with-skills
- المقياس / الوحدة
- pass_rate · percent
APEX-Agents
عمل مهني طويل الأفق في الخدمات المصرفية والاستشارات والقانون باستخدام أدوات المكتب وتنفيذ الشيفرة.
- مصدر المقارنة
- Epoch AI mirror · APEX-Agents
- النسخة / المهام
- APEX-Agents current leaderboard · 480-professional-tasks-33-worlds
- المقياس / الوحدة
- pass_at_1 · percent
Berkeley Function Calling Leaderboard V4
استدعاء الدوال واستخدام الأدوات متعدد الجولات ومقاومة الهلوسة في اختبار BFCL V4 الرسمي.
- مصدر المقارنة
- BFCL V4
- النسخة / المهام
- v4-ede5081a24bc · overall
- المقياس / الوحدة
- overall_accuracy · percent
LMArena Agent Arena
Human preference evaluation of agent outcomes. Every score retains the submitted model, disclosed thinking label, confidence interval and observation count.
- مصدر المقارنة
- LMArena Agent Arena
- النسخة / المهام
- 2026-09-30 · overall-ips-aggregate
- المقياس / الوحدة
- ips_score · ips
AppWorld
Interactive coding-agent benchmark across controllable applications and APIs; model, method, scaffold and task/scenario metrics remain attached to each run.
- مصدر المقارنة
- AppWorld official leaderboard
- النسخة / المهام
- official-c1f56015cf7c · test-challenge-all
- المقياس / الوحدة
- task_goal_completion · percent
Vending-Bench 2
Long-horizon business simulation: mean final balance in USD after a simulated year.
- مصدر المقارنة
- Epoch AI mirror · Vending-Bench 2
- النسخة / المهام
- Vending-Bench 2 current leaderboard · one-simulated-year-mean-final-balance
- المقياس / الوحدة
- mean_final_balance_usd · USD
GDPval-AA v2.1
Successor of GDPval-AA v2: the same 220 tasks and judges, Elo refitted and pinned to DeepSeek V4.1 Flash (max) at 1600 - not comparable with v2 values.
- مصدر المقارنة
- Artificial Analysis · Intelligence Index evaluations
- النسخة / المهام
- GDPval-AA v2.1 (Crowd-BT Elo, DeepSeek V4.1 Flash (max) at 1600) · 220-tasks-elo-v2-1
- المقياس / الوحدة
- elo · points
ماذا تخبرنا البيانات فعلاً؟
لا نكتفي بمعرفة النموذج الأعلى نقاطاً. توضح هذه التحليلات أين تدعم الأدلة المقارنة، وأين تنقص القياسات، وأي استنتاجات تتجاوز ما تسمح به البيانات.
تُحسب المؤشرات من لقطة البيانات نفسها المستخدمة في الجدول. التفسير من LLM Benchmarks، والقياسات من المصادر المذكورة.
كيف تستخدم هذه التحليلات؟
يؤثر اختيار النماذج وتوفر الاختبارات المنشورة في كل تحليل. المزيد من الأدلة يعني معلومات أكثر قابلة للفحص، لا نموذجاً أفضل بالضرورة. لذلك نذكر وحدة العد وتاريخ البيانات والحدود. يُعاد حساب التحليلات مع البيانات المنشورة، وهي ليست إعادة مستقلة لإجراء الاختبارات.
اقرأ مقارنات النماذج ودراسات الحالة →
01النماذج المفتوحة الصغيرة: ما الأدلة التي تدعم المقارنة؟
يتطلب اختيار نموذج مفتوح صغير أكثر من نتيجة جيدة منفردة. نفحص النماذج المختارة التي يقل إجمالي معاملاتها عن ٣٦ ملياراً، لمعرفة عدد أزواج النموذج والاختبار المدعومة بالأدلة، وأين تتوفر أدلة قابلة للمقارنة المباشرة.
تساعد التغطية الواسعة على إعداد قائمة مختصرة. إنها مقياس للأدلة المتاحة، وليست ترتيباً للجودة أو بياناً لاحتياجات الذاكرة.
ما مقدار الأدلة المتاحة؟
يتكون الزوج من نموذج واحد واختبار واحد من الجدول الكامل. تُحسب مستويات التفكير المتعددة مرة واحدة، ولا تُحسب دراسات التكميم دليلاً للنموذج الأساسي. تتطلب صفة «قابل للمقارنة» نتيجة واحدة على الأقل خالية من التعارض وتحمل هذه الصفة في الجدول. يشمل العد جميع الإعدادات الأساسية المسجلة، لا العرض المصفّى الحالي فقط.
يشمل كل شريط جميع الأزواج الممكنة في مجاله. الأعداد: القابلة للمقارنة / الموثقة / الممكنة.
عدّ أجريناه من البيانات العامة. تاريخ البيانات: . JSON · CSV
ماذا يعني ذلك لاختيار النموذج؟
ابحث أولاً عن أدلة في مجال مهمتك. كثرة قياسات المعرفة لا تسد نقص تقييمات وكلاء البرمجة. قارن بعد ذلك الاختبارات المشتركة بين مرشحيك وافحص البروتوكول. لا نستنتج إجمالي المعاملات المجهول من اسم النموذج، ولا يؤهله ذلك للدخول في تحليل ما دون ٣٦ ملياراً.
تمثل الأجزاء الفاتحة من الرسم فجوات المعلومات في بياناتنا. ربما اختُبر نموذج في مكان آخر دون أن نملك سجلاً قابلاً للنشر. كما أن اختيار النماذج منظم. لذلك لا تثبت الأعمدة تفوقاً عاماً للنماذج المفتوحة أو المغلقة.
إعادة حساب التحليل
في ملف JSON، اختر النماذج المفتوحة ذات العدد الإجمالي الموثق للمعاملات الأكبر من صفر والأقل من ٣٦ ملياراً. استخدم اختبارات الموقع فقط. اجمع أدلة النموذج الأساسي مرة واحدة لكل نموذج واختبار، وافصل النسخ المكمّمة. تشمل البيانات نتائج أقدم ما زالت صالحة للنشر. وافحص تواريخ القياسات الفردية قبل اتخاذ قرار الاستخدام.
02الاختبار نفسه في ظروف مختلفة
قد تكون نتيجتان منشورتان صحيحتين دون أن تسمحا بحساب فرق عادل. نعد أزواج النماذج والاختبارات التي تملك أدلة قابلة للمقارنة، ونشرح الفرق باستخدام مسارات التقييم لدينا.
وجود قياسات مشتركة لا يعني تلقائياً قابلية المقارنة المباشرة. يجب تطابق النسخة والمهام والإعداد قبل حساب الفرق.
التوثيق لا يعني دائماً قابلية المقارنة
يعد التحليل الأزواج عبر جميع النماذج المختارة واختبارات الموقع. يُعد الزوج موثقاً عند وجود نتيجة أساسية واحدة على الأقل. وتحتاج قابلية المقارنة أيضاً إلى دليل خالٍ من التعارض يحمل الحالة المقابلة في الجدول. أما البقية فلا تضم إلا أدلة إضافية أو غير قابلة للمقارنة المباشرة. ولا نكرر عد مستويات التفكير.
يشمل كل شريط جميع الأزواج الممكنة في مجاله. الأعداد: القابلة للمقارنة / الموثقة / الممكنة.
عدّ أجريناه من البيانات العامة. تاريخ البيانات: . JSON · CSV
ثلاث حالات يكون فيها الفرق مضللاً
SWE-bench: يمثل نموذج داخل وكيل مزود ونموذج آخر داخل بيئة تقييم موحدة نظامين مختلفين في البداية. تستخدم مقارنتنا الصارمة لـ Verified مسار Vals المحدد. وفي Pro تبقى نتائج الأنظمة المبلغ عنها منفصلة عن المسار القابل للمقارنة المباشرة.
HLE: تختلف مقامات النسب بين مجموعة المهام الكاملة والمجموعة النصية. ويغير استخدام الأدوات أيضاً طرق الحل المسموح بها. لذلك لا يعزل الفرق بالنقاط المئوية بين هذين الإعدادين تحسن النموذج.
SWE-rebench: تغير مجموعات المهام يعني تغير المشكلات المطلوبة. وقد تشكل مجموعة أقدم موثقة مجموعة مقارنة مستقلة. ترتيبها خاص بها، ولا يجوز مساواته بترتيب المجموعة الحالية.
مقارنة مبررة في ثلاث خطوات
اختر نموذجين إلى أربعة ومجالاً مناسباً. اقتصر على الاختبارات المقاسة لجميع النماذج المختارة. ثم افحص مؤشرات قابلية المقارنة والتفاصيل قبل تفسير الفروق مع النموذج المرجعي. حتى الفرق الصحيح تقنياً لا يُعد اختباراً للدلالة الإحصائية.
خلاصتنا: تضيف نتيجة مزود أخرى معلومات، لكنها لا تنشئ تلقائياً ترتيباً عادلاً جديداً. إظهار هذا الفرق أنفع من فرض جميع النتائج على ترتيب واحد.
03التفكير الأكثر لا يضمن نتيجة أفضل
كثيراً ما يُفترض أن زيادة الحساب تؤدي إلى نتيجة أفضل. نبحث في البيانات المنشورة عن أمثلة موثقة يحصل فيها مستوى تفكير ثابت أعلى على نتيجة أسوأ ضمن إعداد التقييم المعلن نفسه.
ينقض المثال المضاد افتراض التحسن المضمون. ولا يعني أن التفكير الأقل أفضل بوجه عام.
أمثلة من لقطة البيانات هذه
نقارن مستويات ثابتة موثقة للنموذج والمصدر ونسخة الاختبار ومجموعة المهام والمقياس والأدوات وتنسيق الوكيل والتقييم نفسها. ويجب تطابق أعداد العينات المبلغ عنها أيضاً. نستخدم أدلة حديثة وحالية من المسار المعتمد، دون تعارض أو تحذير من التلوث. وتُستبعد النتائج المتعددة الملتبسة عند مستوى واحد.
Claude Fable 5.1 · CritPt
CritPt current leaderboard · Epoch AI mirror · CritPt
التواريخ المعتمدة للأدلة: 2 سبتمبر 2026 / 2 سبتمبر 2026. ليس دليلاً على أثر سببي للتفكير.
Claude Fable 5 · Vending 2
Vending-Bench 2 current leaderboard · Epoch AI mirror · Vending-Bench 2
التواريخ المعتمدة للأدلة: 2 سبتمبر 2026 / 2 سبتمبر 2026. ليس دليلاً على أثر سببي للتفكير.
Claude Opus 4.7 · ARC-AGI-1
ARC-AGI-1 current leaderboard · Epoch AI mirror · ARC-AGI-1
التواريخ المعتمدة للأدلة: 2 سبتمبر 2026 / 2 سبتمبر 2026. ليس دليلاً على أثر سببي للتفكير.
ما الذي تثبته هذه الأمثلة؟
هذه أمثلة مضادة مختارة عمداً، وليست عينة ممثلة أو تقديراً لمعدل التكرار. وقد تظل اختلافات تواريخ التقييم والإعدادات غير المعلنة مؤثرة. لا يمكن تحديد سبب فرق النتائج دون تكرار التجارب وتحليل مناسب لعدم اليقين.
لذلك يعرض الجدول افتراضياً أعلى مستوى موثق ضمن سلسلة الاختبارات المختارة، بدلاً من اختيار أفضل نتيجة بأثر رجعي بين المستويات. وهذا يجعل قاعدة الاختيار قابلة للتتبع. اختبر الجودة وزمن الاستجابة والتكلفة معاً في تطبيقك؛ فنتائج الجودة وحدها هنا لا تشكل ترتيباً للكفاءة.
من يدير هذا الموقع؟
يدير Christopher Böhm مشروع LLM Benchmarks بصفة خاصة. يجمع المشروع تقييمات النماذج المنشورة ومصادرها وحدودها للمقارنة في مكان واحد.
الاختيار القابل للتتبع أهم لدينا من قائمة تبدو حاسمة. يجب أن تتيح كل مقارنة الرجوع إلى أدلتها.
ما الذي نضيفه؟
نطابق هويات النماذج ونسخ الاختبارات، ونفصل ظروف الاختبار المختلفة، ونوضح المعلومات غير المؤكدة أو المتعارضة، ونوفر أدوات المقارنة والتنزيل. تشرح الأدلة والتحليلات هذه القرارات. ولا ننسب قياسات الجهات الأخرى إلى أنفسنا بوصفها اختبارات أجريناها.
المسؤولية والصيانة
Christopher Böhm هو المشغّل وجهة التواصل. جمع البيانات والفحوص التقنية مؤتمتان جزئياً. تُدار قواعد النشر ونسبة المصادر والأدلة الإضافية المختارة ضمن المشروع. وقد تنقل الأتمتة أخطاء المصادر، ولذلك تعد روابط المصادر وتفاصيل القياس ووسيلة طلب التصحيح جزءاً من الخدمة.
التمويل وقواعد الاختيار
يقبل المشغّل دعماً طوعياً عبر PayPal. والموقع مُعد أيضاً لمساحة إعلانية يدوية من AdSense. تخضع إضافة النماذج واختيار القياسات والترتيب لقواعد البيانات الموضحة في المنهجية. توثيق المصدر يحدد منشأ النتيجة ولا يمثل توصية بمنتج.
التواصل والتصحيحات
هل وجدت نتيجة خاطئة أو تعريفاً غير صحيح لنموذج أو قيداً غير مذكور؟ أرسل اسم النموذج والاختبار والمعلومة المعنية، ومعها مصدر أصلي إن أمكن. نرحب أيضاً باقتراح اختبارات منشورة لم تُدرج بعد. يرجى عدم إرسال بيانات سرية.