برچسبگذاری صرفی کلمات فارسی
زبانشناسی رایانشیدر سالهای اخیر مسئله زبانشناسی محاسباتی یکی از دغدغههای محققین حوزه کامپیوتر و زبانشناسی شده است. استفاده از کامپیوتر و ابزارهای هوشمند باعث شدهاند که بتوان بسیاری از کارهای مرتبط با متن را با سرعت و دقتی قابل توجه انجام داد. علاوه بر این، قدرت وارد شدن به عرصههایی را که تصور آنها نیز مشکل بوده فراهم کرده است. برای نمونه ترجمه هوشمند، جستجوگرهای معنایی و بسیاری از کارهای دیگر در این زمینه را میتوان نام برد. همچنین هر یک از زبانهای موجود در دنیا به تنهایی میتوانند مخاطب تمامی پردازشهای زبانی قرار گیرد.
برچسبگذاری ادات سخن (Part-of-Speech Tagging)
برچسبگذاری ادات سخن به معنای به دست آوردن گونه صرفی کلمات یک متن است. برای نمونه و با فرض داشتن مجموعه برچسبهای زیر:
جدول1-1- یک نمونه ساده از مجموعه برچسبهای گونه صرفی کلمه

برچسبهای معادل کلمات در عبارت "اولین سیاره خارج از منظومه شمسی دیده شد." به صورت زیر خواهد بود:

روش پیادهسازی: برچسبگذار مبتنی بر مدل مخفی مارکوف (Hidden Markov Model)
استفاده از مدل مخفی مارکوف جهت برچسبگذاری گونههای کلام میتواند به عنوان یک برداشت از تئوریهای احتمالی دانست. این فرآیند به شرح زیر اجراء میگردد:
سؤال این است که برای یک رشته از کلمات گرفته شده، چه ترتیب برچسبی بهترین ترتیب برچسب برای آن رشته کلمات است؟
اگر متن ورودی (ترتیبی از واحدهای صرفی) را به صورت W = (wi)1<i<n نمایش دهیم و یک ترتیب از برچسبهای مجموعه برچسب را با T = (ti)1<i<n مشخص کنیم، هدف ما محاسبه مقدار زیر است:

رابطه فوق بیانگر احتمال تعلق گرفتن رشته برچسبهای T به رشته کلمات W است. با استفاده از قاعده بیز و حذف بخش P(W)، رابطه به صورت زیر تغییر میکند:

P(T|W) احتمال رخداد این ترتیب برچسب (احتمالات مربوط به انتقال برچسبها) را نشان میدهد و میتواند توسط مدل N-gram زیر محاسبه گردد:

نحوه نرمالسازی:

به طوری که:

نحوه محاسبه نیز به صورت زیر میباشد:

دادههای آموزشی و نتایج
در این پروژه برای انجام آزمایشها از پیکره بیجنخان که یک پیکره متنی استاندارد است استفاده کردهایم. این پیکره تقریباً شامل 2.6 میلیون (2,597,937) کلمه برچسبخورده از پیکره همشهری است.
مجموعه برچسب به کار رفته در این پیکره متنی از 40 برچسب تشکیل یافته که هر یک از آنها بیانکننده یک نوع گونه صرفی است. برای آزمایش، از این پیکره، دو میلیون کلمه را به عنوان داده آموزشی و مابقی را به عنوان داده مورد آزمایش انتخاب کردهایم. در میان دو میلیون کلمه ابتدایی، از 40 برچسب موجود، 39 برچسب دیده شد که مجموعه برچسب مطابق با آن تغییر یافت.
نتایج ارزیابی
جدول 3-2- میزان دقت، بازخوانی و معیار F به ازای کل پروژه
| معیار | مقدار |
|---|---|
| دقت (Precision) | 94.3% |
| بازخوانی (Recall) | 94.3% |
| معیار F (F-measure) | 94.3% |