خوشهبندی معنایی کلمات فارسی
چکیده
خوشهبندی یکی از وظایف کاوش داده است که هدف آن تقسیم مجموعهای از اشیاء به گروههایی است بهطوری که اشیاء مشابه در یک گروه قرار گیرند و اشیاء با ویژگیهای متفاوت در گروههای جداگانه و متمایز جای بگیرند. این مقاله تکنیکی را برای خوشهبندی معنایی کلمات ارائه میدهد که یکی از کاربردهای تکنیکهای کاوش داده در حوزه پردازش زبان طبیعی است. خوشهبندی کلمات در زمینههای مختلفی از کاوش متن از جمله ابهامزدایی از کلمات، بازیابی اطلاعات، مدلسازی زبان و طبقهبندی متن مورد استفاده قرار میگیرد. این مقاله روشی مبتنی بر گراف را برای خوشهبندی کلمات فارسی پیشنهاد میکند. روش پیشنهادی نوعی خوشهبندی مبتنی بر الگو است. این روش شامل دو بخش میباشد: در بخش اول، با استفاده از معیارهای شباهت آماری مانند کای-دو (Chi-Square)، اطلاعات متقابل نقطهای (PMI) و شباهت کسینوسی، یک گراف همرخدادی کلمات به دست میآید. در بخش دوم، گراف مذکور با استفاده از الگوریتم خوشهبندی گراف نیومن (Newman) به خوشههای مناسب تقسیم میشود. پژوهشهای ما نشان میدهد که معیار کای-دو بهترین معیار برای خوشهبندی کلمات در زبان فارسی است.