الوسم الصرفي للكلمات الفارسية

اللغويات الحاسوبية
- (0 الأصوات)

الوسم الصرفي للكلمات الفارسية (POS Tagging)

في السنوات الأخيرة، أصبحت معالجة اللغات الحاسوبية (اللسانيات الحاسوبية) واحدة من الاهتمامات الرئيسية للباحثين في مجال علوم الحاسوب واللغويات. إن استخدام الحاسوب والأدوات الذكية جعل من الممكن تنفيذ العديد من المهام المتعلقة بالنصوص بسرعة ودقة ملحوظتين. علاوة على ذلك، فقد وفر القدرة على دخول مجالات كان من الصعب تصورها سابقًا، مثل الترجمة الذكية، ومحركات البحث الدلالية، والعديد من التطبيقات الأخرى. أي لغة في العالم يمكن أن تكون موضوعًا للمعالجة اللغوية.


ما هو وسم أجزاء الكلام (POS Tagging)؟

وسم أجزاء الكلام يعني الحصول على النوع الصرفي (الفئة النحوية) لكل كلمة في النص. على سبيل المثال، بافتراض أن لدينا مجموعة الوسوم التالية:

جدول 1-1: مثال بسيط لمجموعة وسوم الأنواع الصرفية للكلمات

alt

الوسوم المكافئة للكلمات في العبارة "اولین سیاره خارج از منظومه شمسی دیده شد" (تم رؤية أول كوكب خارج المجموعة الشمسية) ستكون على النحو التالي:

alt


طريقة التنفيذ: الوسم باستخدام نموذج ماركوف الخفي (HMM)

يمكن اعتبار استخدام نموذج ماركوف الخفي لوسم أجزاء الكلام نهجًا قائمًا على النظرية الاحتمالية. يتم تنفيذ هذه العملية على النحو التالي:

السؤال هو: بالنسبة لتسلسل معين من الكلمات، ما هو أفضل تسلسل من الوسوم لذلك التسلسل من الكلمات؟

إذا مثلنا النص المدخل (تسلسل الوحدات الصرفية) كـ W = (wi)1<i<n، ومثلنا تسلسلًا من الوسوم من مجموعة الوسوم كـ T = (ti)1<i<n، فإن هدفنا هو حساب ما يلي:

alt

يمثل العلاقة أعلاه احتمال أن تسلسل الوسوم T ينتمي إلى تسلسل الكلمات W. باستخدام قاعدة بايز وإزالة P(W) يمكن تحويل العلاقة على النحو التالي:

alt

يمثل P(T|W) احتمال حدوث تسلسل الوسوم هذا (الاحتمالات المتعلقة بانتقالات الوسوم) ويمكن حسابه باستخدام نموذج N-gram:

alt

طريقة التسوية:

alt

بحيث أن:

alt

طريقة الحساب هي كما يلي:

alt


بيانات التدريب والنتائج

لتجارب هذا المشروع، استخدمنا مجموعة بيجانخان النصية (Bijankhan Corpus)، وهي مجموعة نصوص فارسية قياسية. تحتوي هذه المجموعة على حوالي 2.6 مليون (2,597,937) كلمة موسومة من مجموعة همشهري.

تتكون مجموعة الوسوم المستخدمة في هذه المجموعة النصية من 40 وسمًا، يمثل كل منها نوعًا صرفيًا محددًا. للاختبار، اخترنا مليوني كلمة كبيانات تدريب والباقي كبيانات اختبار. من بين أول مليوني كلمة، تم ملاحظة 39 وسمًا من أصل 40 وسمًا، وتم تعديل مجموعة الوسوم وفقًا لذلك.


نتائج التقييم

جدول 3-2: الدقة والاسترجاع ومقياس F للمشروع بأكمله

المقياس القيمة
الدقة (Precision) 94.3%
الاسترجاع (Recall) 94.3%
مقياس F (F-measure) 94.3%

عينات
النتيجة

قيّم هذا العنصر

متوسط: - ( 0 الأصوات)
تقييمك:

تعليقات

Loading comments...