خطوات الاستخدام
الخطوة الأولى: أدخل إجمالي عدد العمليات الحسابية (FLOPs) التي يتطلبها تشغيل النموذج لاستدلال واحد. يتم حساب FLOPs بناءً على بنية النموذج (عدد الطبقات، حجم المصفوفات، وظائف التنشيط). على سبيل المثال، نموذج GPT-3 بحجم 175 مليار معلمة يتطلب حوالي 3.5 × 10^14 FLOPs لكل استدلال (توليد رمز واحد). يمكنك حساب FLOPs يدويًا أو استخدام أدوات مثل torch.utils.flop_counter.
الخطوة الثانية: أدخل قوة الحوسبة القصوى لوحدة التسريع (accelerator FLOPS) بوحدة FLOPS (أي عملية فاصلة عائمة في الثانية). على سبيل المثال، وحدة NVIDIA A100 تبلغ ذروة أدائها حوالي 312 TFLOPS (3.12 × 10^14 FLOPS) في الدقة المختلطة. تأكد من استخدام القيمة المناسبة لنوع الدقة المستخدمة (FP16، BF16، FP32).
الخطوة الثالثة: انقر على زر الحساب. ستحسب الأداة زمن الاستدلال النظري باستخدام المعادلة: زمن الاستدلال = FLOPs / (acceleratorFLOPS). ومع ذلك، هذا الزمن مثالي ولا يأخذ في الاعتبار عوامل الكفاءة مثل عنق الزجاجة في الذاكرة، توازي المعالجة، ووقت نقل البيانات. في الواقع، قد يكون الزمن الفعلي أكبر بمقدار 2-5 مرات اعتمادًا على الحمل الزائد.