مجموعة بيانات النص والترجمة المتوازية
مجموعة بيانات النص والترجمة المتوازية
تعريف بمجموعة بيانات النص والترجمة المتوازية
مجموعة بيانات النص والترجمة المتوازية هي مجموعة قيمة من النصوص العربية مع ترجماتها الفارسية المكافئة، مما يوفر موردًا غنيًا لأبحاث الترجمة ومعالجة اللغات الطبيعية.
الإحصائيات والأرقام
- أكثر من 260,000 قطعة نصية باللغة العربية
- ترجمة فارسية مكافئة لكل قطعة نصية
- 140 عنوان كتاب مقترن كمصادر للبيانات
محتوى المجموعة
| الميزة | الوصف |
|---|---|
| لغة المصدر | العربية |
| اللغة الهدف | الفارسية |
| الوحدات النصية | أكثر من 260,000 قطعة نصية |
| المصادر | 140 عنوان كتاب مقترن |
التطبيقات
- الترجمة الآلية: تدريب نماذج الترجمة الآلية العصبية (NMT) والإحصائية (SMT)
- معالجة اللغات الطبيعية ثنائية اللغة: تطوير نماذج عبر اللغات
- الدراسات المقارنة: دراسة الهياكل اللغوية المتشابهة والمختلفة في اللغتين
- تقييم الترجمة: إنشاء معايير لتقييم جودة الترجمة
- التعلم الآلي ثنائي اللغة: تدريب نماذج التضمين (Embedding) ثنائية اللغة
الفوائد
- حجم كبير: أكثر من 260,000 قطعة نصية لتدريب النماذج العميقة
- تنوع المصادر: مأخوذة من 140 كتابًا مقترنًا مختلفًا
- محاذاة دقيقة: أزواج جملة-بجملة ونص-بنص
- قابلية تطبيق واسعة: مناسبة لأنواع مختلفة من أنظمة الترجمة الآلية
قيّم هذا العنصر
تعليقات
سجّل الدخول للتعليق
Loading comments...