مشابه‌یابی عناوین هم‌سان

مشابه‌یابی و رده‌بندی متون
- (0 رأی)

چالش پردازش اسناد متنی

روزانه مقالات، اخبار و اسناد متنی فراوانی در محیط رقومی (دیجیتال) تولید و منتشر می‌شود که بررسی درون‌مایه این حجم گسترده اطلاعات، به آسانی امکان‌پذیر نخواهد بود. شمار فراوان متن‌ها، گوناگونی زبانی آنها، طول‌های مختلف و رمزینه‌های متفاوتشان، از دشواری‌های کار با اسناد متنی به شمار می‌روند.

کارشناسان شاخه‌های علمی مختلف، برای حل این مشکل دست به کار شده‌اند. متخصصان هوش مصنوعی، بازیابی اطلاعات، داده‌کاوی و متن‌کاوی و مشابه‌یابی متون، با بهره‌گیری از دانش‌های بازیابی اطلاعات، راهکارهایی ارائه کرده‌اند.


مشابه‌یابی عناوین هم‌سان

«مشابه‌یابی عناوین هم‌سان»، یکی از این مشابه‌یاب‌هاست که با توجه به داده‌های فراوان پایگاه مجلات نورمگز تولید و عرضه شده است.

عناوین هم‌سان، قابلیتی برای کشف هوشمند عنوان‌های مشابه مقاله‌هاست که به کمک ترفندهای متن‌کاوی و هوش مصنوعی، در بازدید هر مقاله، مشابه‌ترین مقالات را از دید عنوان به کاربر پیشنهاد می‌کند.


اهمیت و کاربرد

یافتن مقالات مرتبط با هر مقاله، دغدغه‌ای پژوهشی است که برای سامان‌دهی پژوهش‌های جامع و غیرتکراری در کم‌ترین زمان، باید بدان پاسخ گفت. اصلی‌ترین شیوه برای شناخت ارتباط مقالات با یک‌دیگر، بررسی الفاظ مشترک میان عنوان‌های آنهاست. این ابزار از عنوان مقالات برای شناسایی ارتباط آنها با یک‌دیگر بهره می‌گیرد.


کاربردها در پایگاه‌های خبری و علمی

بهره‌گیری از مشابه‌یاب‌ها برای کشف روابط پنهان داده‌های متنی با یک‌دیگر، کاربردهای گوناگونی دارد:

  • پایگاه‌های خبری: برای شناسایی ارتباط اخبار مختلف با یک‌دیگر (مانند بخش اخبار گوگل[1] یا بخش «در همین زمینه» پایگاه خبری همشهری[2])
  • پایگاه‌های علمی: مانند بخش «See also» دانش‌نامه ویکی‌پدیا[3]

نوآوری در نورمگز

تنها ویژگی کاربردی در فرآیند مشابه‌یابی، عنوان مقاله‌هاست، اما طراحان نورمگز کوشیده‌اند که مشابه‌یابی‌ها از سطح لفظ عنوان مقالات بگذرند و به معنا و موضوع آنها نزدیک‌تر شود.

ازاین‌رو، آزمون‌های گوناگونی در بخش متن‌کاوی مرکز تحقیقات کامپیوتری علوم اسلامی صورت گرفت تا این گذر به شیوه بهتری صورت پذیرد.


ترفندهای مورد استفاده

سامان‌دهی لایه‌ای از خوشه‌بندی معنایی کلمات، نمونه‌ای از ترفندها در این آزمون‌هاست. این ترفند به کشف بسیاری از روابط «باهم‌آیی کلمات» خواهد انجامید.

باهم‌آیی کلمات (Word Co-occurrence)

باهم‌آیی دو کلمه با یک‌دیگر بدین معناست که حضور یکی از آن کلمات، حضور دیگری را در پی خواهد داشت. برای نمونه، با رخداد کلمه‌ای مانند «نفت»، بسیار محتمل است که واژه «گاز» نیز به کار رود.

از سوی دیگر، باهم‌آیی دو کلمه، نشان‌دهنده مشترکاتی میان آنهاست. این مشترکات در بسیاری از کلمات، خصلت‌های معنایی آنهاست. ازاین‌رو، فرآیند خوشه‌بندی معنایی به کمک رابطه باهم‌آیی آنها امکان‌پذیر خواهد بود.


ویژگی‌های منحصربه‌فرد

ترفندهای معمول در این ویژگی، با دیگر موتورهای جستجو متفاوتند و کارکردهایی دارند که خود حاصل پژوهش‌های محققان بومی است:

  • خوشه‌بندی کلمات
  • جداسازی واژگان کلیدی از دیگر واژگان
  • مؤثرتر کردن آنها برای محاسبات مشابه‌یابی


مراجع

[1] Google News

[2] Hamshahri News Agency

[3] Wikipedia



به این مورد امتیاز دهید

میانگین: - ( 0 رأی)
امتیاز شما:

نظرات

Loading comments...