عنوان‌های هم‌سان؛ کشف هوشمند عنوان‌های هم‌سانِ مقاله‌ای از انبوه مقالات

عنوان‌های هم‌سان؛ کشف هوشمند عنوان‌های هم‌سانِ مقاله‌ای از انبوه مقالات
1405/02/30

چالش پردازش اسناد متنی

روزانه مقالات و اخبار و اسناد متنی فراوانی در محیط رقومی (دیجیتال) تولید و منتشر می‌شود که بررسی درون‌مایه این حجم گسترده اطلاعات، به آسانی امکان‌پذیر نخواهد بود. شمار فراوان متن‌ها، گوناگونی زبانی آنها، طول‌های مختلف و رمزینه‌های متفاوتشان، از دشواری‌های کار با اسناد متنی به شمار می‌روند.

کارشناسان شاخه‌های علمی مختلف، برای حل این مشکل دست به کار شده‌اند. متخصصان هوش مصنوعی، بازیابی اطلاعات، داده‌کاوی و متن‌کاوی و مشابه‌یابی متون، با بهره‌گیری از دانش‌های بازیابی اطلاعات، راهکارهایی ارائه کرده‌اند.


عنوان‌های هم‌سان چیست؟

«عنوان‌های هم‌سان»، یکی از این مشابه‌یاب‌هاست که با توجه به داده‌های فراوان پایگاه مجلات نورمگز تولید و عرضه شده است.

عنوان‌های هم‌سان، قابلیتی برای کشف هوشمند عنوان‌های مشابه مقاله‌هاست که به کمک ترفندهای متن‌کاوی و هوش مصنوعی، در بازدید هر مقاله، مشابه‌ترین مقالات را از دید عنوان به کاربر پیشنهاد می‌کند.


اهمیت و کاربرد

یافتن مقالات مرتبط با هر مقاله، دغدغه‌ای پژوهشی است که برای سامان‌دهی پژوهش‌های جامع و غیرتکراری در کم‌ترین زمان، باید بدان پاسخ گفت. اصلی‌ترین شیوه برای شناخت ارتباط مقالات با یک‌دیگر، بررسی الفاظ مشترک میان عنوان‌های آنهاست. این ابزار از عنوان مقالات برای شناسایی ارتباط آنها با یک‌دیگر بهره می‌گیرد.


کاربردها در پایگاه‌های خبری و علمی

بهره‌گیری از مشابه‌یاب‌ها برای کشف روابط پنهان داده‌های متنی با یک‌دیگر، کاربردهای گوناگونی دارد:

  • پایگاه‌های خبری: برای شناسایی ارتباط اخبار مختلف با یک‌دیگر (مانند بخش اخبار پایگاه گوگل[1] یا بخش «در همین زمینه» پایگاه خبری همشهری[2])
  • پایگاه‌های علمی: مانند بخش «See also» دانش‌نامه ویکی‌پدیا[3]

نوآوری در نورمگز

تنها ویژگی کاربردی در فرآیند مشابه‌یابی، عنوان مقاله‌هاست، اما طراحان نورمگز کوشیده‌اند که مشابه‌یابی‌ها از سطح لفظ عنوان مقالات بگذرند و به معنا و موضوع آنها نزدیک‌تر شود.

ازاین‌رو، آزمون‌های گوناگونی در بخش متن‌کاوی مرکز تحقیقات کامپیوتری علوم اسلامی صورت گرفت تا این گذر به شیوه بهتری صورت پذیرد.


ترفندهای مورد استفاده

سامان‌دهی لایه‌ای از خوشه‌بندی معنایی کلمات، نمونه‌ای از ترفندها در این آزمون‌هاست. این ترفند به کشف بسیاری از روابط «باهم‌آیی کلمات» خواهد انجامید.

باهم‌آیی کلمات

باهم‌آیی دو کلمه با یک‌دیگر بدین معناست که حضور یکی از آن کلمات، حضور دیگری را در پی خواهد داشت. برای نمونه، با رخداد کلمه‌ای مانند «نفت»، بسیار محتمل است که واژه «گاز» نیز به کار رود.

از سوی دیگر، باهم‌آیی دو کلمه، نشان‌دهنده مشترکاتی میان آنهاست. این مشترکات در بسیاری از کلمات، خصلت‌های معنایی آنهاست. ازاین‌رو، فرآیند خوشه‌بندی معنایی به کمک رابطه باهم‌آیی آنها امکان‌پذیر خواهد بود.


ویژگی‌های منحصربه‌فرد

ترفندهای معمول در این ویژگی، با دیگر موتورهای جستجو متفاوتند و کارکردهایی دارند که خود حاصل پژوهش‌های محققان بومی است:

  • خوشه‌بندی کلمات
  • جداسازی واژگان کلیدی از دیگر واژگان
  • مؤثرتر کردن آنها برای محاسبات مشابه‌یابی

چشم‌انداز آینده

این ویژگی‌ها در دست گسترش هستند؛ چنانکه به خواست خدا ویژگی عنوان‌های هم‌سان در نسخه‌های آینده، از دقت و کیفیت بیشتری برخوردار خواهند بود.


امیدبخشی

بخش متن‌کاوی مرکز تحقیقات کامپیوتری علوم اسلامی امیدوار است که با عرضه این ویژگی، راه پژوهش برای محققان حوزه و دانشگاه هموارتر شود.



مراجع

[1] Google News

[2] Hamshahri News Agency

[3] Wikipedia



به این مورد امتیاز دهید

میانگین: - ( 0 رأی)
امتیاز شما:

نظرات

Loading comments...