استخراج رویداد از متون عربی کلاسیک
چکیده
استخراج رویداد یکی از مفیدترین و در عین حال چالشبرانگیزترین وظایف استخراج اطلاعات (IE) است که میتواند در بسیاری از کاربردهای پردازش زبان طبیعی، بهویژه سیستمهای جستجوی معنایی، مورد استفاده قرار گیرد. اکثر سیستمهای توسعهیافته در این حوزه، رویدادها را از متون انگلیسی استخراج میکنند؛ بنابراین، در بسیاری از زبانهای دیگر، بهویژه زبان عربی، نیاز به پژوهش در این زمینه احساس میشود. در این مقاله، سامانهای برای استخراج رویدادهای مرتبط با اشخاص و شرکتکنندگان آنها از متون عربی کلاسیک با ساختار زبانی پیچیده توسعه دادهایم. نخستین و مؤثرترین گام در استخراج رویداد، تشخیص صحیح اشاره به رویداد و تعیین جملاتی است که رویدادها را توصیف میکنند. پیادهسازی و مقایسه عملکرد و استفاده از روشهای مختلف میتواند به پژوهشگران کمک کند تا بر اساس شرایط و محدودیتهای خود، روش مناسب برای استخراج رویداد را انتخاب کنند. در این پژوهش، سه روش شامل روش مبتنی بر دانش (بر اساس مجموعهای از کلیدواژهها و قوانین)، روش مبتنی بر داده (بر اساس ماشین بردار پشتیبان یا SVM) و روش مبتنی بر معنا (بر اساس زنجیره واژگانی) را برای طبقهبندی خودکار جملات به دو دسته «جملات حاوی رویداد» و «جملات فاقد رویداد» پیادهسازی کردهایم. نتایج نشان میدهد که روشهای مبتنی بر دانش و یادگیری ماشین دارای دقت و فراخوانی بالایی در فرآیند استخراج رویداد هستند. روش مبتنی بر معنا نیز با دقت قابلقبول، نیازهای دانش زبانیِ روش مبتنی بر دانش و نیازهای پیشپردازشِ روش مبتنی بر داده را به حداقل میرساند و همچنین فرآیند استخراج خودکار رویداد از متن خام را بهبود میبخشد. گام بعدی، توسعه یک رویکرد پیمانهای مبتنی بر قانون برای استخراج استدلالهای رویداد (مانند زمان، مکان و سایر شرکتکنندگان درگیر) در زیروظایف مستقل است.