بهبود کارایی الگوریتم K-نزدیک‌ترین همسایه برای طبقه‌بندی متن فارسی

نویسندگان: Mohammad Hossein Elahimanesh, Behrouz Minaei-Bidgoli, Hossein Malekinezhad
چکیده

یکی از فرآیندهای رایج در حوزه کاوش متن، طبقه‌بندی متن است. به دلیل ماهیت پیچیده زبان فارسی، کلمات با اجزای جداگانه و افعال ترکیبی، اکثر سیستم‌های طبقه‌بندی متن برای متون فارسی قابل اجرا نیستند. الگوریتم K-نزدیک‌ترین همسایه (KNN) یکی از روش‌های پرکاربرد در طبقه‌بندی متن است که عملکرد خوبی را در آزمایش‌ها روی مجموعه‌داده‌های مختلف نشان داده است. در این مقاله، روشی برای بهبود عملکرد طبقه‌بندی KNN پیشنهاد شده است. همچنین تأثیر حذف یا حفظ کلمات ایستایی و به‌کارگیری ان‌گرام‌ها با طول‌های مختلف مورد بررسی قرار گرفته است. برای این پژوهش، از بخشی از پیکره استاندارد فارسی همشهری۱ و مقالات برخی روزنامه‌های بایگانی‌شده استفاده شده است. همان‌طور که نتایج نشان می‌دهد، کارایی طبقه‌بندی با به‌کارگیری این رویکرد بهبود می‌یابد، به‌ویژه زمانی که از روش ایندکس‌گذاری ۸-گرامی و حذف کلمات ایستایی استفاده می‌شود. استفاده از ان‌گرام‌ها با طول بیش از ۳ کاراکتر، نتایج بسیار امیدوارکننده‌ای را برای طبقه‌بندی متن فارسی نشان داده است. نتایج طبقه‌بندی با استفاده از روش پیشنهادی ما با نتایج حاصل از کارهای مرتبط ذکرشده مقایسه شده است.

کلمات کلیدی
Text classification N-grams of characters K-nearest neighbor

به این مورد امتیاز دهید

میانگین: - ( 0 رأی)
امتیاز شما:

نظرات

Loading comments...