چارچوبی برای اصلاح املا در زبان فارسی با استفاده از مدل کانال نویزی

نویسندگان: Mohammad Hoseyn Sheykholeslam, Behrouz Minaei-Bidgoli, Hossein Juzi
چکیده

برای تصحیح املا در زبان فارسی روش‌های مختلفی وجود دارد. متأسفانه به دلیل عدم وجود پیکره جامع، چارچوب قدرتمندی پیاده‌سازی نشده است. در این پژوهش، یک پیکره جامع از خطاهای فارسی جمع‌آوری شده و چارچوبی برای تصحیح املای متن فارسی ارائه شده است. این چارچوب شامل دو بخش اصلی تشخیص خطا و اصلاح خطا می‌باشد. در بخش تشخیص خطا، پس از یافتن کلمات erroneous در متن نمونه، برنامه ما برخی کاندیداهای مرتبط برای اصلاح را پیشنهاد می‌دهد. این مقاله بر توصیف روش رتبه‌بندی اصلاحات مرتبط تمرکز دارد. این روش نسخه سفارشی‌شده‌ای از تصحیح املای کانال نویزی برای فارسی است. این روش رتبه‌بندی تلاش می‌کند تا اصلاح مورد نظر c را از یک تایپو t پیدا کند که P(c) P(t | c) را بیشینه می‌کند. در این مقاله روش‌های مختلف توصیف و تحلیل شده‌اند تا نمای کلی گسترده‌ای از این حوزه به دست آید. نتایج ارزیابی ما نشان می‌دهد که مدل کانال نویزی با استفاده از پیکره و مجموعه آموزش ما در این چارچوب، دقیق‌تر عمل کرده و در مقایسه با سایر روش‌ها به طور کارآمدی بهبود می‌یابد.

کلمات کلیدی
Spelling Error Correction Noisy Channel Model Persian Language

به این مورد امتیاز دهید

میانگین: - ( 0 رأی)
امتیاز شما:

نظرات

Loading comments...