استخراج رویداد
استخراج اطلاعاتاهمیت و جایگاه استخراج رویداد
استخراج رویداد یکی از مهمترین و چالشبرانگیزترین وظیفههای استخراج اطلاعات است که به عنوان زیربنایی برای بسیاری از کاربردهای پردازش زبان طبیعی مانند:
- جستجوی معنایی اطلاعات
- خلاصهسازی متون
- و غیره
به شمار میرود.
تعریف استخراج رویداد
استخراج رویداد به تشخیص و استخراج رویدادهای مهم مانند:
- رویداد مرگ
- تولد
- درگیری
- و دیگر موارد
در متونی با زبان طبیعی میپردازد.
مراحل استخراج رویداد
استخراج رویداد از دو مرحلهی کلی تشکیل شده است:
1. استخراج حوزهی رویداد (تشخیص جملات حاوی رویداد)
2. استخراج اطلاعات و عوامل درگیر در رویداد (تشخیص آرگومانها)
ویژگی خاص این پروژه
در این پروژه به استخراج رویداد و اطلاعات مربوط به آن در متون اسلامی تاریخی عربی پرداخته شده است که دارای ساختار زبانشناسی پیچیده و متفاوت نسبت به متون متداول امروزی است و میتواند ابزاری بسیار مفید برای محققین در این حوزه باشد.
مراحل و روششناسی
مرحله اول - تشخیص حوزه رویداد
تشخیص درست حوزهٔ رویداد و تعیین جملاتی که رویداد را توصیف میکنند به عنوان اولین و مؤثرترین گام، صحت فرایند استخراج اطلاعات رویداد را تحت تأثیر قرار میدهد.

عناصر شرکتکننده در رویداد
عناصر شرکتکننده در رویداد میتوانند شامل موارد زیر باشند:
- افراد و یا سازمانها
- تاریخ
- زمان
- مکان
- دیگر اطلاعات مرتبط با آن رویداد
نمونهای از شناسایی هوشمند رویدادهای تاریخی خاص (مثل رویداد مرگ)

روش ردهبندی دودویی
در این سیستم با مسئلهٔ تعیین جملات شامل رویداد به صورت یک مسئلهٔ ردهبندی متن به صورت دودویی رفتار شده است که به هر یک از نمونههای متن (جمله)، یکی از دو کلاس زیر را نسبت میدهد:
| کلاس | توضیح |
|---|---|
| On-Event | جمله شامل یک یا چند نمونه از نوع رویداد مورد نظر باشد |
| Off-Event | جمله شامل هیچ نمونهای از نوع رویداد مورد نظر نباشد |

کاربردها
- تحقیقات تاریخی: استخراج خودکار رویدادهای مهم از متون تاریخی اسلامی
- جستجوی معنایی: یافتن رویدادهای مرتبط با پرسش کاربر
- خلاصهسازی متون: تولید خلاصههای مبتنی بر رویداد
- ساخت پایگاههای اطلاعات رویدادمحور: ایجاد دانشنامههای رویدادمحور از متون اسلامی
جهتگیری تحقیقاتی آینده
به عنوان کارهای تحقیقاتی پیش رو میتوان:
- با افزودن صفات بیشتر، تأثیر آنها را بر کارایی و نتیجهٔ ردهبند (بر پایهٔ ماشین بردار پشتیبان - SVM) مشاهده نمود
- روشی برای خودکارسازی انتخاب صفات تأثیرگذار و تعداد آنها پیشنهاد داد
- برای بهبود روش مبتنی بر زنجیرهٔ لغوی، علاوه بر تعداد کلمات مشترک بین جملهٔ مورد پردازش و زنجیرهٔ لغوی، عوامل دیگری مانند زمان و نوع کلمه را نیز در انتخاب جمله به عنوان جملهٔ شامل رویداد دخیل دانست
- سیستم را به گونهای توسعه داد که با بهرهگیری از سیستمهای ایجاد قانون به تولید قوانین استخراج با استفاده از یک مجموعه قوانین اولیه بپردازد (کاهش نیاز به مدیر دانش برای ایجاد مجموعهٔ بزرگی از قوانین)