مجموعة بيانات النص والترجمة المتوازية

مجموعة بيانات النص والترجمة المتوازية

مجموعة بيانات النص والترجمة المتوازية


تعريف بمجموعة بيانات النص والترجمة المتوازية

مجموعة بيانات النص والترجمة المتوازية هي مجموعة قيمة من النصوص العربية مع ترجماتها الفارسية المكافئة، مما يوفر موردًا غنيًا لأبحاث الترجمة ومعالجة اللغات الطبيعية.


الإحصائيات والأرقام

  • أكثر من 260,000 قطعة نصية باللغة العربية
  • ترجمة فارسية مكافئة لكل قطعة نصية
  • 140 عنوان كتاب مقترن كمصادر للبيانات

محتوى المجموعة

الميزة الوصف
لغة المصدر العربية
اللغة الهدف الفارسية
الوحدات النصية أكثر من 260,000 قطعة نصية
المصادر 140 عنوان كتاب مقترن

التطبيقات

  • الترجمة الآلية: تدريب نماذج الترجمة الآلية العصبية (NMT) والإحصائية (SMT)
  • معالجة اللغات الطبيعية ثنائية اللغة: تطوير نماذج عبر اللغات
  • الدراسات المقارنة: دراسة الهياكل اللغوية المتشابهة والمختلفة في اللغتين
  • تقييم الترجمة: إنشاء معايير لتقييم جودة الترجمة
  • التعلم الآلي ثنائي اللغة: تدريب نماذج التضمين (Embedding) ثنائية اللغة

الفوائد

  • حجم كبير: أكثر من 260,000 قطعة نصية لتدريب النماذج العميقة
  • تنوع المصادر: مأخوذة من 140 كتابًا مقترنًا مختلفًا
  • محاذاة دقيقة: أزواج جملة-بجملة ونص-بنص
  • قابلية تطبيق واسعة: مناسبة لأنواع مختلفة من أنظمة الترجمة الآلية

قيّم هذا العنصر

متوسط: - ( 0 الأصوات)
تقييمك:

تعليقات

Loading comments...