خطوات الاستخدام
الخطوة الأولى: فهم مفهوم الرمز (Token) في معالجة النصوص. الرمز هو وحدة صغيرة من النص، وقد يكون كلمة، أو رقمًا، أو علامة ترقيم. في هذه الحاسبة، نعتبر كل كلمة أو مجموعة أحرف مفصولة بمسافة رمزًا واحدًا. هذا الأسلوب يُبسّط عملية العد، ولكن قد لا يكون مثاليًا لبعض اللغات أو النصوص المعقدة. بعد إدخال النص في الحقل المخصص، ستقوم الحاسبة بتقسيم النص بناءً على المسافات البيضاء.
الخطوة الثانية: حساب عدد الرموز الإجمالي (Total Token Count). بمجرد إدخال النص، تقوم الحاسبة بتطبيق خوارزمية بسيطة: تُقسّم النص إلى أجزاء عند كل مسافة، ثم تحسب عدد الأجزاء الناتجة. هذا العدد هو إجمالي الرموز. على سبيل المثال، النص 'مرحبًا بالعالم' سينتج رمزين: 'مرحبًا' و'بالعالم'. هذا المقياس مفيد لتقدير حجم النص أو حساب تكلفة معالجة النماذج اللغوية التي تعتمد على عدد الرموز.
الخطوة الثالثة: حساب نسبة الرموز الفريدة (Unique Token Ratio). بعد حساب العدد الإجمالي، تُحسب أيضًا عدد الرموز الفريدة (الكلمات المختلفة) عن طريق إزالة المكررات. ثم تُقسم الرموز الفريدة على الإجمالي للحصول على النسبة. تعبر هذه النسبة عن تنوع المفردات في النص. النسبة العالية تعني وجود مفردات متنوعة، والنسبة المنخفضة تعني تكرار الكلمات. على سبيل المثال، النص 'السلام السلام' له رمزان مكرران، لذا النسبة الفريدة = (1/2) = 0.5.