مقدمة في مجموعة نور اللغوية ونموذجها اللغوي

المؤلفون: Mohammad Hossein Elahimanesh, Behrouz Minaei-Bidgoli, Mohammad Javad Gholami, Hossein Juzi
الملخص

في علم اللسانيات، يُعرّف "مجموعة النصوص" (Corpus) بأنها مجموعة كبيرة من الوثائق النصية. تُستخدم مجموعات النصوص لاستخراج القوانين الخفية للغات. وكأحد تطبيقات البحوث الإحصائية واستخراج هذه القوانين الخفية، يتم بناء نماذج لغوية لاستخدامها في تطبيقات استرجاع المعلومات. تقدم هذه الورقة واحدة من أكبر مجموعات النصوص في العلوم الإسلامية، والمُسمّاة "مجموعة نور" (Noor Corpus)، ثم تعرض النموذج اللغوي لهذه المجموعة. تُعدّ مجموعة نور نتاج عقد من الزمان من الجهود التي بذلها باحثون في العلوم الشرعية ومهندسو حاسوب في "مركز أبحاث الحاسوب للعلوم الإسلامية" (CRCIS). تتضمن هذه المجموعة آلاف الكتب الإسلامية المصنّفة ضمن فئات مختلفة. ومعظم النصوص الموجودة هي باللغة العربية والفارسية. تحتوي المجموعة على 1.2 مليار كلمة عربية، بالإضافة إلى 616 مليون كلمة فارسية. وتتضمن النماذج اللغوية الثنائية (Bigram) لهذه المجموعة 80 مليون ثنائي كلمات (Bigram) متميز في اللغة العربية، و44 مليون ثنائي كلمات متميز في اللغة الفارسية.

الكلمات المفتاحية
Islamic Corpus Language Model Natural Language Processing

قيّم هذا العنصر

متوسط: - ( 0 الأصوات)
تقييمك:

تعليقات

Loading comments...