LLM Benchmarks

قياسات موثقة بالمصادر

آخر تحديث للصفحة
AR
♡ دعم

تحليلات ودراسات نماذج

قارن النماذج المفتوحة الصغيرة بقياسات ملموسة وافهم اختلاف نتائج SWE-bench. تحليلات أصلية مع المصادر والحدود الواضحة.

ثلاثة نماذج مفتوحة بأقل من 36 مليار معلمة

اخترنا تحريرياً Qwen 3.8 27B وQwen 3.6 35B-A3B وGemma 4 31B IT: مزودان وبنى كثيفة وبنى خليط خبراء. هذه العينة ليست ترتيباً للأفضل. السؤال الأول هو وجود قياسات قابلة للمقارنة للمهمة نفسها.

Qwen 3.8 27B

إجمالي المعلمات: 27 مليار

نموذج كثيف

Qwen 3.6 35B-A3B

إجمالي المعلمات: 35 مليار

المعلمات النشطة: 3 مليار

مزيج الخبراء (MoE)

Gemma 4 31B IT

إجمالي المعلمات: 30.7 مليار

نموذج كثيف

نستخدم لكل نموذج واختبار النتيجة الأساسية المختارة وفق قواعد الجدول. نستبعد النسخ المكمّمة والأدلة القديمة أو غير المؤكدة حالياً والتعارضات وتحذيرات التلوث. داخل كل رسم يجب تطابق المصدر والإصدار والمهام والمقياس والوكيل والأدوات والتقييم. تبقى إعدادات التفكير المختلفة ظاهرة؛ وهذا لا يثبت تساوي ميزانيات الحوسبة.

المقياس من 0 إلى 100٪. تشترك قيم المجموعة الواحدة فقط في الإعداد المعلن. لا نحسب تفوقاً بين المجموعات.

GPQA

دليل منفرد: لا يوجد نظير مطابق للمقارنة في هذه العينة
Vals AI GPQA Diamond · GPQA Diamond v1 · Vals dual-prompt · diamond-198-zero-and-five-shot-cot
Qwen 3.8 27B88.89 %
جهد الاستدلال: xhigh

الدليل الأصلي: Vals AI GPQA Diamond ↗

تاريخ الدليل: المصدر أو الرصد:

لا توجد نتيجة أساسية حالية تستوفي هذه القواعد: Qwen 3.6 35B-A3B · Gemma 4 31B IT.

دليل الاختبارات →

SciCode

إعداد تقييم معلن مشترك
Epoch AI mirror · SciCode · SciCode current leaderboard · scientific-research-coding-subproblems
Qwen 3.8 27B46.6 %
جهد الاستدلال: xhigh

الدليل الأصلي: Epoch AI mirror · SciCode ↗

تاريخ الدليل: المصدر أو الرصد:

Qwen 3.6 35B-A3B1.3 %
جهد الاستدلال: متوقف

الدليل الأصلي: Epoch AI mirror · SciCode ↗

تاريخ الدليل: المصدر أو الرصد:

Gemma 4 31B IT43.4 %
جهد الاستدلال: غير مذكور

الدليل الأصلي: Epoch AI mirror · SciCode ↗

تاريخ الدليل: المصدر أو الرصد:

أعلى تقدير نقطي معروض داخل هذه المجموعة: Qwen 3.8 27B.

دليل الاختبارات →

LiveCodeBench

دليل منفرد: لا يوجد نظير مطابق للمقارنة في هذه العينة
Vals AI · LiveCodeBench · Vals LiveCodeBench v1 · vals-livecodebench-overall
Qwen 3.8 27B84 %
جهد الاستدلال: xhigh

الدليل الأصلي: Vals AI · LiveCodeBench ↗

تاريخ الدليل: المصدر أو الرصد:

لا توجد نتيجة أساسية حالية تستوفي هذه القواعد: Qwen 3.6 35B-A3B · Gemma 4 31B IT.

دليل الاختبارات →

القيمة الأعلى لا تثبت تفوقاً إحصائياً. قد تبقى اختلافات غير منشورة في الإعدادات المعلنة.

يقدم GPQA دليلاً على حل المسائل العلمية. يختبر SciCode البرمجة العلمية وLiveCodeBench البرمجة التنافسية. لذلك لا يحدد التفوق في GPQA أي نموذج سيعالج شيفرتك أفضل. حدد مجال المهمة أولاً وقارن القيم داخل المجموعة نفسها فقط.

استنتاجنا: الأدلة المشتركة المناسبة أنفع للاختيار الأولي من متوسط هذه الاختبارات الثلاثة. عند غياب قياس مشترك تبقى فجوة معرفية. كذلك لا يثبت العدد الإجمالي للمعلمات وحده مقدار الذاكرة المطلوبة أو سرعة تشغيل نسخة محلية مكمّمة.

افتح هذه النماذج الثلاثة في جدول المقارنة →

↑ العودة إلى الموضوعات

النموذج نفسه ونتيجتان في SWE-bench

يوضح Claude Opus 5 لماذا لا يكفي اسما النموذج والاختبار. نعرض تشغيل Vals المستقل بجانب تقرير المزود التكميلي. تبقى كل نتيجة مرتبطة بمصدرها وإعداد تقييمها.

تشغيل مقارنة موحد

Claude Opus 5 · SWE-bench

97 %

إعداد التقييم المعلن

  • SWE-bench Verified v1
  • verified-500-vals-mini-swe-agent
  • Vals AI mini-swe-agent
  • Bash
  • Vals AI independent run over all 500 verified tasks; uniform minimal bash-only mini-swe-agent harness

الدليل الأصلي: Vals AI SWE-bench Verified ↗

تاريخ الدليل: المصدر أو الرصد:

تقرير مزود تكميلي

Claude Opus 5 · SWE-bench

96 %

إعداد التقييم المعلن

  • Anthropic 500-task evaluation
  • verified-500
  • unspecified agentic harness
  • not reported
  • adaptive thinking; max effort; five-trial average

الدليل الأصلي: Anthropic · Claude Opus 5 System Card ↗

تاريخ الدليل: المصدر أو الرصد:

يذكر سجل Vals استخدام mini-swe-agent وBash. ويصف تقرير المزود إعداداً مختلفاً أو غير مكتمل الإفصاح. تختلف أيضاً معلومات التفكير والتكرار. لذلك لا يمكن إرجاع فرق الدرجات إلى سبب واحد؛ فهو لا يثبت تحسن النموذج ولا خطأ أحد المصدرين.

لمقارنة نماذج مختلفة نبدأ بمجموعة Vals الموحدة. نستخدم تقرير المزود دليلاً إضافياً للنظام المختبر لديه. يبقى اختبار مستودعك ووكيلك بميزانية ثابتة للوقت والرموز ضرورياً لاستخدامك الخاص.

↑ العودة إلى الموضوعات

استخدم الأمثلة لبناء قائمتك الأولية

  1. حدد المهمة واختر نموذجين إلى أربعة نماذج.
  2. تحقق من القياسات المشتركة وإعداداتها واترك الفجوات واضحة.
  3. اختبر النماذج المتبقية على مهامك من حيث الجودة والوقت والتكلفة.
المنهجية وتحليلات إضافية →