خطوات الاستخدام
أدخل عدد الطبقات (layers): يمثل هذا العدد عدد طبقات التشفير (Transformer blocks) في النموذج. كل طبقة تحتوي على انتباه ذاتي وشبكة عصبية تغذية أمامية. يزيد عدد الطبقات من قدرة النموذج على التعلم ولكنه يزيد أيضًا من العمليات الحسابية.
أدخل أبعاد النموذج (modelDim): هو حجم المتجهات المخفية (d_model) في كل طبقة. تحدد هذه القيمة سعة النموذج وقدرته على تمثيل المعلومات. تتراوح القيم النموذجية من 512 إلى 12288 للنماذج الكبيرة.
أدخل طول التسلسل (seqLen): هو عدد الرموز (tokens) في تسلسل الإدخال. يؤثر طول التسلسل بشكل كبير على العمليات الحسابية بسبب تعقيد O(n^2) في طبقة الانتباه. كلما زاد الطول، زادت حسابات الانتباه بشكل تربيعي.
أدخل حجم المفردات (vocabSize): هو عدد الرموز الفريدة في قاموس النموذج. يستخدم هذا لحساب عمليات طبقة الإخراج (output projection) حيث يتم تحويل المتجه المخفي إلى توزيع احتمالي على المفردات. تأثيرها خطي وليس تربيعي.