ثلاثة نماذج مفتوحة بأقل من 36 مليار معلمة
اخترنا تحريرياً Qwen 3.8 27B وQwen 3.6 35B-A3B وGemma 4 31B IT: مزودان وبنى كثيفة وبنى خليط خبراء. هذه العينة ليست ترتيباً للأفضل. السؤال الأول هو وجود قياسات قابلة للمقارنة للمهمة نفسها.
Qwen 3.8 27B
إجمالي المعلمات: 27 مليار
نموذج كثيف
Qwen 3.6 35B-A3B
إجمالي المعلمات: 35 مليار
المعلمات النشطة: 3 مليار
مزيج الخبراء (MoE)
Gemma 4 31B IT
إجمالي المعلمات: 30.7 مليار
نموذج كثيف
نستخدم لكل نموذج واختبار النتيجة الأساسية المختارة وفق قواعد الجدول. نستبعد النسخ المكمّمة والأدلة القديمة أو غير المؤكدة حالياً والتعارضات وتحذيرات التلوث. داخل كل رسم يجب تطابق المصدر والإصدار والمهام والمقياس والوكيل والأدوات والتقييم. تبقى إعدادات التفكير المختلفة ظاهرة؛ وهذا لا يثبت تساوي ميزانيات الحوسبة.
المقياس من 0 إلى 100٪. تشترك قيم المجموعة الواحدة فقط في الإعداد المعلن. لا نحسب تفوقاً بين المجموعات.
GPQA
Vals AI GPQA Diamond · GPQA Diamond v1 · Vals dual-prompt · diamond-198-zero-and-five-shot-cot
لا توجد نتيجة أساسية حالية تستوفي هذه القواعد: Qwen 3.6 35B-A3B · Gemma 4 31B IT.
دليل الاختبارات →SciCode
Epoch AI mirror · SciCode · SciCode current leaderboard · scientific-research-coding-subproblems
أعلى تقدير نقطي معروض داخل هذه المجموعة: Qwen 3.8 27B.
LiveCodeBench
Vals AI · LiveCodeBench · Vals LiveCodeBench v1 · vals-livecodebench-overall
لا توجد نتيجة أساسية حالية تستوفي هذه القواعد: Qwen 3.6 35B-A3B · Gemma 4 31B IT.
دليل الاختبارات →القيمة الأعلى لا تثبت تفوقاً إحصائياً. قد تبقى اختلافات غير منشورة في الإعدادات المعلنة.
يقدم GPQA دليلاً على حل المسائل العلمية. يختبر SciCode البرمجة العلمية وLiveCodeBench البرمجة التنافسية. لذلك لا يحدد التفوق في GPQA أي نموذج سيعالج شيفرتك أفضل. حدد مجال المهمة أولاً وقارن القيم داخل المجموعة نفسها فقط.
استنتاجنا: الأدلة المشتركة المناسبة أنفع للاختيار الأولي من متوسط هذه الاختبارات الثلاثة. عند غياب قياس مشترك تبقى فجوة معرفية. كذلك لا يثبت العدد الإجمالي للمعلمات وحده مقدار الذاكرة المطلوبة أو سرعة تشغيل نسخة محلية مكمّمة.
افتح هذه النماذج الثلاثة في جدول المقارنة →