تحسين وسم أدوات الكلام للكلمات المجهولة في النصوص الفارسية بمساعدة قواعد الجمعيات
الملخص
تناقش هذه المقالة وتبحث في أحد التحديات الكبرى في اللسانيات الحاسوبية، ألا وهو وسم أجزاء الكلام (POS Tagging) للكلمات المجهولة. يُعدّ وسم أجزاء الكلام من المتطلبات الأساسية لمعالجة النصوص الذكية، وهو يعتمد بشكل كبير على لغة النص المراد معالجته. وعليه، فقد كان توفير موسِّم (Tagger) عالي الدقة للغة الفارسية ضمن أولويات عملAuthors المقالة. التقنية التي اعتمدناها لحل مشكلة الكلمات المجهولة هي نهج هجين يجمع بين خوارزمية نموذج ماركوف المخفي (HMM) وقواعد الارتباط (Association Rules). لقد استُخدمت خوارزمية نموذج ماركوف المخفي على نطاق واسع في العديد من موسِّمات أجزاء الكلام السابقة [2,3]، وتُعدّ من أفضل الطرق المستخدمة في أنظمة الوسم. ووفقًا للتجارب التي أُجريت في هذه الدراسة، فإن استخدام قواعد الارتباط ساهم في رفع دقة وسم الكلمات الفارسية المجهولة إلى 81.2%. في حين أن الدقة الإجمالية التراكمية للموسِّم المقترح تصل إلى 98%.