وسم أجزاء كلام النصوص الفارسية بمساعدة نموذج ماركوف المخفي
الملخص
يتناول هذا المستند أحد التحديات الكبرى في مجال اللسانيات الحاسوبية والمتمثل في وسم أجزاء الكلام (Part-of-Speech Tagging). يُعدّ وسم أجزاء الكلام من المتطلبات الأساسية لمعالجة النصوص الذكية، وهو يعتمد على لغة النص المراد معالجته. وعليه، فقد كان توفير نظام قوي لوسم أجزاء الكلام للغة الفارسية ضمن أولويات عملنا. التقنية التي اعتمدناها لحل هذه المشكلة هي نموذج ماركوف المخفي (Hidden Markov Model). تُستخدم هذه التقنية على نطاق واسع في العديد من أساليب الوسم؛ فعلى سبيل المثال، تُستخدم في موسِّم TNT [2] الذي يُعدّ من أقوى الموسِّمات في لغات متعددة [4, 5, 8]. وفقًا للتجارب التي أجريناها، فإن استخدام هذا الموسِّم يتيح تحديد الأنواع الصرفية للكلمات الفارسية بدقة تصل إلى 94.3%.
قيّم هذا العنصر
تعليقات
سجّل الدخول للتعليق
Loading comments...