خطوات الاستخدام
أدخل عدد الرؤوس (heads): هذا هو عدد رؤوس الانتباه المستخدمة في النموذج. عادةً ما يكون 8 أو 16 في النماذج الحديثة مثل BERT أو GPT. كل رأس يتعامل مع جزء من البعد الكلي للنموذج، حيث يكون بُعد كل رأس (d_k) مساوياً لـ dModel مقسومًا على عدد الرؤوس. تذكر أن زيادة عدد الرؤوس قد يحسن تمثيل الأنماط المختلفة في البيانات، لكنه يزيد من التعقيد الحسابي.
أدخل بُعد النموذج (dModel): هذا هو حجم التمثيل (embedding dimension) لكل رمز في التسلسل. في المحولات (Transformers)، يكون عادةً 512 أو 768 أو 1024. هذا البعد يحدد سعة النموذج وقدرته على تعلم الميزات المعقدة.
أدخل طول التسلسل (seqLen): عدد الرموز في التسلسل المدخل (مثل عدد الكلمات في جملة). كلما زاد الطول، زادت العمليات الحسابية بشكل تربيعي في جزء الانتباه (أي مربع طول التسلسل)، وهذا هو السبب في أن التعامل مع التسلسلات الطويلة صعب من الناحية الحسابية.