چارچوبی برای اصلاح املا در زبان فارسی با استفاده از مدل کانال نویزی
چکیده
برای تصحیح املا در زبان فارسی روشهای مختلفی وجود دارد. متأسفانه به دلیل عدم وجود پیکره جامع، چارچوب قدرتمندی پیادهسازی نشده است. در این پژوهش، یک پیکره جامع از خطاهای فارسی جمعآوری شده و چارچوبی برای تصحیح املای متن فارسی ارائه شده است. این چارچوب شامل دو بخش اصلی تشخیص خطا و اصلاح خطا میباشد. در بخش تشخیص خطا، پس از یافتن کلمات erroneous در متن نمونه، برنامه ما برخی کاندیداهای مرتبط برای اصلاح را پیشنهاد میدهد. این مقاله بر توصیف روش رتبهبندی اصلاحات مرتبط تمرکز دارد. این روش نسخه سفارشیشدهای از تصحیح املای کانال نویزی برای فارسی است. این روش رتبهبندی تلاش میکند تا اصلاح مورد نظر c را از یک تایپو t پیدا کند که P(c) P(t | c) را بیشینه میکند. در این مقاله روشهای مختلف توصیف و تحلیل شدهاند تا نمای کلی گستردهای از این حوزه به دست آید. نتایج ارزیابی ما نشان میدهد که مدل کانال نویزی با استفاده از پیکره و مجموعه آموزش ما در این چارچوب، دقیقتر عمل کرده و در مقایسه با سایر روشها به طور کارآمدی بهبود مییابد.