بهبود کارایی الگوریتم K-نزدیکترین همسایه برای طبقهبندی متن فارسی
چکیده
یکی از فرآیندهای رایج در حوزه کاوش متن، طبقهبندی متن است. به دلیل ماهیت پیچیده زبان فارسی، کلمات با اجزای جداگانه و افعال ترکیبی، اکثر سیستمهای طبقهبندی متن برای متون فارسی قابل اجرا نیستند. الگوریتم K-نزدیکترین همسایه (KNN) یکی از روشهای پرکاربرد در طبقهبندی متن است که عملکرد خوبی را در آزمایشها روی مجموعهدادههای مختلف نشان داده است. در این مقاله، روشی برای بهبود عملکرد طبقهبندی KNN پیشنهاد شده است. همچنین تأثیر حذف یا حفظ کلمات ایستایی و بهکارگیری انگرامها با طولهای مختلف مورد بررسی قرار گرفته است. برای این پژوهش، از بخشی از پیکره استاندارد فارسی همشهری۱ و مقالات برخی روزنامههای بایگانیشده استفاده شده است. همانطور که نتایج نشان میدهد، کارایی طبقهبندی با بهکارگیری این رویکرد بهبود مییابد، بهویژه زمانی که از روش ایندکسگذاری ۸-گرامی و حذف کلمات ایستایی استفاده میشود. استفاده از انگرامها با طول بیش از ۳ کاراکتر، نتایج بسیار امیدوارکنندهای را برای طبقهبندی متن فارسی نشان داده است. نتایج طبقهبندی با استفاده از روش پیشنهادی ما با نتایج حاصل از کارهای مرتبط ذکرشده مقایسه شده است.