التجميع الدلالي للكلمات الفارسية

المؤلفون: Alireza Arasteh, Mohammad Hossein Elahimanesh, Ahmad Sharif, Behrouz Minaei-Bidgoli
الملخص

يُعدّ التجميع (Clustering) إحدى مهام تنقيب البيانات التي تهدف إلى تقسيم مجموعة من الكائنات إلى مجموعات، بحيث تقع الكائنات المتشابهة في نفس المجموعة، بينما توضع الكائنات ذات الخصائص المختلفة في مجموعات منفصلة ومتمايزة. تقدم هذه الورقة تقنية لتجميع الكلمات دلاليًا، وهو أحد تطبيقات تقنيات تنقيب البيانات في مجال معالجة اللغات الطبيعية. يُستخدم تجميع الكلمات في مجالات متنوعة من تنقيب النصوص مثل حل غموض الكلمات، واسترجاع المعلومات، والنمذجة اللغوية، وتصنيف النصوص. تقترح هذه الورقة طريقة قائمة على الرسم البياني (Graph-based) لتجميع الكلمات الفارسية. تُعدّ الطريقة المقترحة نوعًا من التجميع القائم على الأنماط، وتتكون من جزأين: في الجزء الأول، وباستخدام مقاييس التشابه الإحصائية مثل "كاي تربيع" (Chi-Square)، و"المعلومات المتبادلة النقطية" (PMI)، و"تشابه جيب التمام" (Cosine)، يتم الحصول على رسم بياني للتواجد المشترك للكلمات. وفي الجزء الثاني، يتم تقسيم هذا الرسم البياني إلى عناقيد مناسبة باستخدام خوارزمية نيومان لتجميع الرسوم البيانية. أظهرت أبحاثنا أن مقياس "كاي تربيع" هو الأفضل لتجميع الكلمات في اللغة الفارسية.

الكلمات المفتاحية
Word Clustering Text Mining Persian NLP Graph-base Clustering

قيّم هذا العنصر

متوسط: - ( 0 الأصوات)
تقييمك:

تعليقات

Loading comments...