مقدمه‌ای بر پیکره نور و مدل زبانی آن

نویسندگان: Mohammad Hossein Elahimanesh, Behrouz Minaei-Bidgoli, Mohammad Javad Gholami, Hossein Juzi
چکیده

در زبان‌شناسی، پیکره متنی به مجموعه بزرگی از اسناد متنی اطلاق می‌شود. از پیکره‌های متنی برای استخراج قوانین پنهان زبان‌ها استفاده می‌گردد. به عنوان یکی از کاربردهای پژوهش‌های آماری و استخراج این قوانین پنهان، مدل‌های زبانی ساخته می‌شوند تا در برنامه‌های بازیابی اطلاعات مورد استفاده قرار گیرند. در این مقاله، یکی از بزرگ‌ترین پیکره‌های متنی در حوزه علوم اسلامی را که «پیکره نور» نام دارد، معرفی کرده و سپس مدل زبانی این پیکره را ارائه می‌دهیم. پیکره نور حاصل یک دهه تلاش محققان علوم دینی و مهندسان کامپیوتر در «مرکز تحقیقات کامپیوتری علوم اسلامی» (CRCIS) است. این پیکره شامل هزاران کتاب اسلامی است که در دسته‌بندی‌های مختلفی طبقه‌بندی شده‌اند. اکثر متون موجود به زبان‌های عربی و فارسی هستند. این پیکره حاوی ۱.۲ میلیارد کلمه عربی و همچنین ۶۱۶ میلیون کلمه فارسی می‌باشد. مدل‌های زبانی بی‌گرام (Bigram) این پیکره شامل ۸۰ میلیون بی‌گرام متمایز عربی و ۴۴ میلیون بی‌گرام متمایز فارسی هستند.

کلمات کلیدی
Islamic Corpus Language Model Natural Language Processing

به این مورد امتیاز دهید

میانگین: - ( 0 رأی)
امتیاز شما:

نظرات

Loading comments...