خطوات الاستخدام
الخطوة 1: اختيار النموذج — اختر نموذج اللغة الذي تريد مقارنته من القائمة المنسدلة. تشمل النماذج المتاحة GPT-4، GPT-3.5، Llama 2، Claude 3، Gemini وغيرها. تأكد من اختيار النموذج الذي يتوافق مع إصدار محدد (مثل GPT-4-0613) لأن الأداء يختلف بين الإصدارات. كل نموذج له معمارية فريدة وطريقة تدريب تؤثر على نتائجه في المعايير المختلفة.
الخطوة 2: اختيار المقياس — اختر المقياس (المعيار) الذي تريد تقييم النموذج بناءً عليه. المعايير المتاحة هي MMLU (فهم اللغة متعدد المهام)، GSM8K (الاستدلال الرياضي)، و HumanEval (توليد الكود). لكل معيار منهجية تقييم مختلفة: MMLU يقيس المعرفة العامة عبر 57 موضوعاً، GSM8K يركز على مسائل رياضية متدرجة الصعوبة، و HumanEval يقيس قدرة النموذج على توليد دوال برمجية صحيحة.
الخطوة 3: عرض النتائج — بعد اختيار النموذج والمقياس، اضغط على زر 'مقارنة' لرؤية النتيجة. ستظهر النتيجة كنسبة مئوية (مثل 85.4%) مع مقارنة بمتوسط أداء النماذج الأخرى في نفس المقياس. كما يتم عرض رسم بياني يوضح أداء النموذج عبر عدة معايير ليسهل المقارنة البصرية.