تحسين فعالية خوارزمية الجار الأقرب (KNN) لتصنيف النصوص الفارسية
الملخص
تُعد تصنيف النصوص واحدة من العمليات الشائعة في مجال تنقيب النصوص. وبسبب الطبيعة المعقدة للغة الفارسية، والكلمات ذات الأجزاء المنفصلة والأفعال المركبة، فإن معظم أنظمة تصنيف النصوص غير قابلة للتطبيق على النصوص الفارسية. تُعتبر خوارزمية الجار الأقرب (KNN) واحدة من أكثر الطرق استخداماً في تصنيف النصوص وتُظهر أداءً جيداً في التجارب على مجموعات بيانات مختلفة. تقترح هذه الورقة طريقة لتحسين أداء التصنيف في خوارزمية KNN. كما تم دراسة تأثير إزالة أو الإبقاء على الكلمات الدالة، وتطبيق تقنية N-Grams بأطوال مختلفة. في هذه الدراسة، تم استخدام جزء من مجموعة البيانات الفارسية القياسية المسماة Hamshahri1 ومقالات من بعض الصحف المؤرشفة. وكما تشير النتائج، فإن كفاءة التصنيف تتحسن بتطبيق هذا النهج، خاصة عند استخدام طريقة فهرسة 8-grams وإزالة الكلمات الدالة. وقد أظهر استخدام N-grams بأطوال تزيد عن 3 أحرف نتائج مشجعة جداً لتصنيف النصوص الفارسية. وتم مقارنة نتائج التصنيف باستخدام طريقتنا مع النتائج التي تم الحصول عليها من الأعمال ذات الصلة المذكورة.