مقدمهای بر پیکره نور و مدل زبانی آن
چکیده
در زبانشناسی، پیکره متنی به مجموعه بزرگی از اسناد متنی اطلاق میشود. از پیکرههای متنی برای استخراج قوانین پنهان زبانها استفاده میگردد. به عنوان یکی از کاربردهای پژوهشهای آماری و استخراج این قوانین پنهان، مدلهای زبانی ساخته میشوند تا در برنامههای بازیابی اطلاعات مورد استفاده قرار گیرند. در این مقاله، یکی از بزرگترین پیکرههای متنی در حوزه علوم اسلامی را که «پیکره نور» نام دارد، معرفی کرده و سپس مدل زبانی این پیکره را ارائه میدهیم. پیکره نور حاصل یک دهه تلاش محققان علوم دینی و مهندسان کامپیوتر در «مرکز تحقیقات کامپیوتری علوم اسلامی» (CRCIS) است. این پیکره شامل هزاران کتاب اسلامی است که در دستهبندیهای مختلفی طبقهبندی شدهاند. اکثر متون موجود به زبانهای عربی و فارسی هستند. این پیکره حاوی ۱.۲ میلیارد کلمه عربی و همچنین ۶۱۶ میلیون کلمه فارسی میباشد. مدلهای زبانی بیگرام (Bigram) این پیکره شامل ۸۰ میلیون بیگرام متمایز عربی و ۴۴ میلیون بیگرام متمایز فارسی هستند.