خوشه‌بندی معنایی کلمات فارسی

نویسندگان: Alireza Arasteh, Mohammad Hossein Elahimanesh, Ahmad Sharif, Behrouz Minaei-Bidgoli
چکیده

خوشه‌بندی یکی از وظایف کاوش داده است که هدف آن تقسیم مجموعه‌ای از اشیاء به گروه‌هایی است به‌طوری که اشیاء مشابه در یک گروه قرار گیرند و اشیاء با ویژگی‌های متفاوت در گروه‌های جداگانه و متمایز جای بگیرند. این مقاله تکنیکی را برای خوشه‌بندی معنایی کلمات ارائه می‌دهد که یکی از کاربردهای تکنیک‌های کاوش داده در حوزه پردازش زبان طبیعی است. خوشه‌بندی کلمات در زمینه‌های مختلفی از کاوش متن از جمله ابهام‌زدایی از کلمات، بازیابی اطلاعات، مدل‌سازی زبان و طبقه‌بندی متن مورد استفاده قرار می‌گیرد. این مقاله روشی مبتنی بر گراف را برای خوشه‌بندی کلمات فارسی پیشنهاد می‌کند. روش پیشنهادی نوعی خوشه‌بندی مبتنی بر الگو است. این روش شامل دو بخش می‌باشد: در بخش اول، با استفاده از معیارهای شباهت آماری مانند کای-دو (Chi-Square)، اطلاعات متقابل نقطه‌ای (PMI) و شباهت کسینوسی، یک گراف هم‌رخدادی کلمات به دست می‌آید. در بخش دوم، گراف مذکور با استفاده از الگوریتم خوشه‌بندی گراف نیومن (Newman) به خوشه‌های مناسب تقسیم می‌شود. پژوهش‌های ما نشان می‌دهد که معیار کای-دو بهترین معیار برای خوشه‌بندی کلمات در زبان فارسی است.

کلمات کلیدی
Word Clustering Text Mining Persian NLP Graph-base Clustering

به این مورد امتیاز دهید

میانگین: - ( 0 رأی)
امتیاز شما:

نظرات

Loading comments...