خطوات الاستخدام
الخطوة الأولى: فهم مفهوم الجولات في XGBoost. في خوارزمية تعزيز التدرج (Gradient Boosting)، تشير الجولات (n_estimators) إلى عدد الأشجار التي يتم بناؤها بشكل متتالٍ. كل جولة تحاول تصحيح أخطاء الجولة السابقة. اختيار العدد الأمثل أمر بالغ الأهمية: عدد قليل جدًا يؤدي إلى نقص التعلم (underfitting)، وعدد كبير جدًا يؤدي إلى فرط التعلم (overfitting). القاعدة الأساسية: كلما زاد حجم مجموعة البيانات (عدد العينات والخصائص)، زادت الحاجة إلى جولات أكثر، ولكن مع معدل تعلم أقل. العلاقة الرياضية التقريبية هي: الجولات المثلى ≈ (عدد العينات × عدد الخصائص) / (معدل التعلم × ثابت). الثابت يعتمد على التعقيد، ويمكن تقديره بـ 100 تقريبًا. أدخل عدد العينات (samples): يمثل حجم بيانات التدريب. كلما زادت العينات، زادت الحاجة إلى جولات للتقاط الأنماط.
الخطوة الثانية: إدخال عدد الخصائص (features). الخصائص هي المتغيرات المستقلة المستخدمة للتنبؤ. كلما زاد عدد الخصائص، زاد تعقيد النموذج، مما يتطلب جولات إضافية لتعلم العلاقات. لكن احذر: عدد كبير جدًا من الخصائص مع عدد قليل من العينات قد يؤدي إلى فرط التعلم بسرعة. أدخل عدد الخصائص في الحقل المخصص.
الخطوة الثالثة: إدخال معدل التعلم (learning rate). معدل التعلم (eta) يتحكم في مساهمة كل شجرة. عادة ما تكون القيم بين 0.01 و 0.3. معدل تعلم صغير يتطلب جولات أكثر لتحقيق أداء جيد، بينما معدل كبير يقلل الجولات المطلوبة ولكن قد يؤدي إلى عدم الاستقرار. العلاقة عكسية تقريبًا: المضاعفة في معدل التعلم تقلل الجولات إلى النصف. أدخل معدل التعلم.