خطوات الاستخدام
الخطوة 1: أدخل زمن الاستدلال الأصلي (original latency) بوحدة المللي ثانية (ms). هذا الزمن يمثل المدة التي يستغرقها نموذجك لتوليد استجابة واحدة على وحدة معالجة الرسوميات (GPU) باستخدام الدقة الأصلية (عادة FP32). تأكد من قياس هذا الزمن باستخدام أداة موثوقة (مثل NVIDIA Nsight أو TensorRT profiling) للحصول على قيمة دقيقة. كلما كان الزمن أصغر، كلما كان التطبيق أسرع، ولكن التحسين يهدف إلى تقليله أكثر.
الخطوة 2: اختر الدقة (precision) المستهدفة التي تريد تحويل النموذج إليها باستخدام TensorRT. الخيارات: FP32 (دقة عائمة 32 بت، لا تحسين في السرعة ولكنه المرجع)، FP16 (دقة عائمة 16 بت، يوفر تسريعًا يتراوح بين 1.5x إلى 2x عادةً)، وINT8 (عدد صحيح 8 بت، يوفر تسريعًا يتراوح بين 2x إلى 4x). يجب مراعاة أن الدقة المنخفضة قد تؤدي إلى فقدان طفيف في دقة النموذج، لكن TensorRT يستخدم تقنيات معايرة لتقليل هذا التأثير.
الخطوة 3: اضغط على زر "احسب" ليقوم النظام بتقدير زمن الاستدلال المحسن. تستخدم الحاسبة معاملات تسريع نموذجية مأخوذة من أداء NVIDIA على نماذج شائعة (مثل ResNet وBERT). المعادلة المستخدمة: الزمن المحسن = الزمن الأصلي / عامل التسريع. حيث عامل التسريع يعتمد على الدقة: FP32: 1.0، FP16: 1.8 (قيمة افتراضية، قد تختلف بين 1.5-2.0 حسب النموذج)، INT8: 3.5 (قيمة افتراضية، قد تتراوح بين 2.5-4.0). هذه القيم تقريبية، والنتيجة الفعلية تعتمد على حجم النموذج، هندسة GPU، وتطبيق تحسينات TensorRT المحددة.